产品中心
发布日期:2026-08-28 12:01 点击次数:161

安康缓粘结预应力钢绞线 把20万行代码换套时刻栈, 算作分绝不差, Claude、GPT全懵了

钢绞线

从 SWE-bench Verified 到 SWE Pro,再到 DeepSWE,模子们一经把这套题目快刷到头了 —— 建设 bug、收尾,这些 “ bounded repair ” 任务安康缓粘结预应力钢绞线,现时的大模子一经作念得实足好,好到可以省心让它们东说念主值守地跑。

但的确的软件工程,从来不仅仅修 bug。

DeepSWE 一经撕开了说念口子 —— 当考题从 “改几行代码” 酿成跨文献长任务改写,顶模子通过率从 96 跌至 70。

但 DeepSWE 仍然不是至极。

对 Coding Agents 的终稽查不是腹地剪辑,而是扫数这个词代码库的演进。

把套 20 万行的系统,从 C 言语扫数这个词重写成 Rust,接口不变、算作不变、旧代码沿途删掉 —— 这才是工程师日期上的确填满的责任。 而这件事,AI 还远远作念不到。

比 DeepSWE 浮躁的 “” 新基准

Einsia AI 旗下 Navers Lab 近放出了个新基准 ——SWE Refactor Bench,该模式在 X 发布后得回了 50 万次浏览,并引起了国外社区 3000 多个联系掂量。

论文题目:SWE Refactor Bench: Can Coding Agents Complete a Long-Horizon, Whole-Repository Stack Migration?

模式主页:https://lab.einsia.ai/swe-refactor-bench

Arxiv:https://arxiv.org/abs/2608.23564

Github repo:https://github.com/Einsia/SWE-Refactor-Bench

如若说 DeepSWE 考的是 “在现存代码库里收尾个新”,那 SWE Refactor Bench 考的是 “重建”。

20 个的确开源模式,包括 SQLite、zlib、libsodium、GraphHopper 这些工业基础算作,统共 86.7 万行代码、10,594 个文献。

任务分为四类:

言语重写(7 个):C→Rust、C→Java、Python→Go、JavaScript→Rust……

框架搬动(7 个):Flask→Starlette、Express→Fastify、Vue→React……

平台移植(3 个):POSIX→WebAssembly、CommonJS→V8 realm……

构建器具搬动(3 个):Autotools→CMake、Maven→Gradle……

每说念题的要求王人样:把扫数这个词仓库搬到另个时刻栈上,旧代码沿途删掉,外部算作分绝不差。

层层设卡:三关之下安康缓粘结预应力钢绞线,路可退

SWE Refactor Bench 的评测不是跑遍测试就分。它竖立了三说念关卡,轨则实行,任何干不外即出局。

关:搬动审查。 旧时刻栈有莫得从源码和构建居品中隐匿?不外则票否决。

二关:测试。 130,118 项稽查,精准校验算作是否分绝不差。

前两关通过之后,迎来凶残的三关 ——「让 AI 当黑客,去黑 AI 我方写的代码」。六个立的 Coding Agent 考证器,各有小时,向这份提交发起袭击,只好可实行的反例才算数。

成果:

考证器找到流毒的中位期间:仅 17 分钟

强考证器(Claude Opus-5)的破率过 50,其他模子只好约 24。

扫数模子,防患未然

8 个前沿模子,26 种设置,20 个任务,统共 520 次立尝试,成果只好 28 次提交通过了沿途三轮评测 —— 告捷率 5.4。

扎心的是:3 个模子从新到尾莫得产生任何个可汲取的提交 —— 让它们跑 20 个任务,个王人过不了。

把 520 次尝试圮绝看:

340 次(65.4)通过了 “搬动审查”—— 至少看起来像作念了搬动

118 次(22.7)达到了 “算作测试的满分”—— 扫数预设的测试王人通过了

只好 88 次同期蓬勃这两个条款,参加了三轮

终只好 28 次活了下来

20 项任务中,13 项东说念主解出。

两种本事:“完成搬动” 和 “保合手算作”,根本不是回事

偷懒的,预应力钢绞线和逞强的。

这是 SWE Refactor Bench 反直观的筹谋。

传统 benchmark 的起先是 “有 bug 的代码”—— 测试挂了,修好了就阐扬你作念了事。但搬动任务的起先是个一经能跑的系统。AI 如若把代码刻舟求剑交且归,测试照样全过 —— 算作满分,但活点没干。

论文管这叫 “盲区”:不是测试集不够,是它根本看不见 “有莫得改”。

而偷懒,仅仅其中种。

还有另条路 —— 逞强。252 次提交硬着头皮把搬动作念了,但算作没保住,卡在了测试上。代码如实换了,跑起来却不合。

偷懒的,算作满分但没作念。逞强的,作念了但算作出错。 两条路,王人到不了至极。八个模子例外,全在这两个向之间扭捏。

“代码是对的” 和 “搬动是确凿”—— 个王人不可少。 而今天强的模子,于今还没学会同期作念到。

后公里:99 的正确率,离请托还差步

对次仓库搬动而言,任何条单位测试欠亨过王人是紧要风险 —— 那条失败的测试背后是个的确的下流销耗者,它不会因为另外 99.99 的算作王人对而不出事。

而这恐怕是智能体过不去的说念坎。

在 340 次如实完成了搬动的开动中:

91 能让固定测试集过半

58 能到 99

36 能到 99.9

只好 26 能条可以

仅后这小步就淘汰了一经走到 99.9 的 123 次开动中的 35 次。而这后小步有的致站点上每个书签、每条共享出去的络续王人会失;有的让出来的包发布出去后,模式主页是片空缺。

这不是测试集吹毛求疵,是搬动自己没作念完。

写在后

SWE Refactor Bench 揭示了三件事:

,算作测试在搬动场景下会失。 原系统原来就能通过扫数测试,AI 交白卷也能拿满分。这不是测试隐敝率的锅,是 “尺子量错了对象”—— 它在测 “有莫得改坏”,而不是 “有莫得改”。

二,“完成搬动” 和 “保合手算作” 是两码事。 少数模子遴荐了偷懒根柢没作念搬动,浩荡模子遴荐了逞强后弄坏了算作。模子能把算作收复到 99 以上,但终经得起沿途稽查的不到相称之。难的不是把算作作念得接近,而是后公里。

三,AI 会写代码,但还不会作念系统软件工程。 520 次尝试,仅有 28 次告捷。20 项任务,13 项东说念主解出。

这不是在说 “AI 不行”。 这是在说:咱们终于有了个能测出 “AI 到底行不行” 的尺子。

代码可以重写。算作分绝不差 —— 这才是难的部分。

而这,恰正是软件工程的试验。手机号码:15222026333相关词条:离心玻璃棉     塑料挤出机     钢绞线厂家    铝皮保温    pvc管道管件胶

1.本网站以及本平台支持关于《新广告法》实施的“极限词“用语属“违词”的规定,并在网站的各个栏目、产品主图、详情页等描述中规避“违禁词”。
2.本店欢迎所有用户指出有“违禁词”“广告法”出现的地方,并积极配合修改。
3.凡用户访问本网页,均表示默认详情页的描述,不支持任何以极限化“违禁词”“广告法”为借口理由投诉违反《新广告法》,以此来变相勒索商家索要赔偿的违法恶意行为。

推荐资讯
友情链接: