Signal Brief

Anthropic 用 Claude Code 实现百万行代码迁移新模式

Anthropic 团队使用 Claude Code 将 Zig 项目迁移到 Rust,百万行代码不到两周完成,100% 测试通过,仅 19 个回归问题全部修复,成本约 16.5 万美元。文章介绍了六步迁移流程,强调以强 judge 和对抗 agent 验证测试断言,可复制的工厂流水线模板将语言级重...

twitter关注列表 AYi (@AYi_AInotes) 发布 2026-07-22 收录 2026-07-22 值得跟进

一句话判断

该方法将迁移成本从数百万美元降至十万美元,提供可复制的流程模板值得关注

核心信息

Anthropic 团队使用 Claude Code 将 Zig 项目迁移到 Rust,百万行代码不到两周完成,100% 测试通过,仅 19 个回归问题全部修复,成本约 16.5 万美元。文章介绍了六步迁移流程,强调以强 judge 和对抗 agent 验证测试断言,可复制的工厂流水线模板将语言级重构门槛降至小团队可行。

原始内容

大多数团队对待代码迁移的态度是能拖就拖,不是不想动是动不起,几百万行代码换语言换架构动辄四年几百万美元,失败一次就是灾难级事故。 Anthropic 刚用 Claude Code 跑通了另一条路。Bun 创始人把整个项目从 Zig 迁到 Rust,百万行代码不到两周,现有测试套件 100% 通过 CI 才合并,上线只出 19 个回归全部修完。成本约 16.5 万美元,Mike Krieger 一个周末把 Python 代码库迁到 16.5 万行 TypeScript,几百个 agent 八道阶段门三轮对抗审查,最后做全命令输出对比。 以前迁移是押宝项目,现在迁移是删 branch 重来的成本。你不修复代码,你修复产生代码的过程。 六步流程的精髓不在步骤本身,在一个前置约束:先有一个强 judge,把原有测试改写成能同时跑在新旧两边的断言,再用对抗 agent 验证它不会被稀释,没有 judge 后面全是空转。然后定规则建依赖图找 gap, 压力测试规则用同一规则翻三个文件跟资深工程师风格翻三个文件对比 diff 专门找系统性漏洞,这一步发现的问题会指数级放大必须在全量之前杀掉。全量翻译时规则只读只增不改,两个独立 reviewer 默认假设所有代码都是错的,每个 finding 必须引用规则或源码行,人类只处理模式修正。编译失败测试挂掉行为不一致直接变成下一轮 agent 的工作项,失败不再是事故是队列里的下一项。 反常识的地方在这里。最贵的不在迁移本身,在前期的规则定义和压力测试,人类时间几乎全部花在 Rulebook 上,规则写错一次后面全是垃圾。看到同一个错误出现三次以上立刻停止修实例升级到改规则,大模型只用来写规则和做高风险审查,高并发实现用中小模型既省钱又防大模型在细节上乱发挥。旧代码永远是 ground truth,测试失败先跑旧代码确认,旧代码也挂那是继承问题不是你的锅,永远不削弱测试来让队列变短。 对个人和小团队这扇门是真的开了。以前语言级重构是大厂专属,现在有了可复制的工厂流水线模板,一个慢性痛点编译太久内存持续泄漏生态萎缩就够了,最坏情况删掉重来。真正的杠杆不在 AI 写代码更快,在正确性验证和制造过程本身也变成了可被 agent 迭代的对象,你不再修代码,你修那个修代码的 loop。 ![photo](https://pbs.twimg.com/media/HN0Z9cQWUAAWoAi.jpg) > **引用原帖 ClaudeDevs (@ClaudeDevs):** > https://t.co/rx3FQSosu0 > https://x.com/ClaudeDevs/status/2079654423828304282

相关动态

01

AutoLab: Can Frontier Models Solve Long-Horizon Auto Research and Engineering Tasks?

研究人员提出了 AutoLab 基准测试,包含 36 项涉及系统加速、谜题、模型开发及 CUDA kernel 工作的任务,旨在评估模型在长时程自动研究中的表现。通过对 17 个主流模型的测试发现,成功的关键不在于初始想法的质量,而在于模型的持续测试与反馈迭代能力;其中 Claude Opus 4.6 在该基准测试中表现最佳,原因在于其能...

twitter关注列表2026-07-22#技术#模型#研究
观察
02

Tencent Hy3 Agent Arena排名#25

Arena.ai评测显示,腾讯Hy3模型在Agent Arena中排名第25位(开放权重模型第5位),在Frontend Code Arena中排名第16位(开放模型第2位)。Hy3在工具使用(bash错误恢复,+2.6%)方面表现强劲,但在可操纵性(用户推回时调整能力)方面较弱,得分为-7.1%。

twitter关注列表2026-07-22#模型#评测#技术
观察
03

百度开源Unlimited-OCR模型

百度开源 Unlimited-OCR 模型,30亿参数但推理时仅5亿激活,支持一次性处理40页文档,32K上下文窗口,准确率93%(比基线高6%),错误率低于0.11,输出结构化Markdown,免费本地运行,对比亚马逊Textract等商用方案每页收费。

twitter关注列表2026-07-20#模型发布#开源#技术突破
观察
04

小红书 dots-note-3.0 在 IMO 获满分认证

小红书团队开发的 dots-note-3.0(dots 3 的轻量化内部版本)在 2026 年国际奥林匹克数学竞赛(IMO)中获得 42 分满分成绩,超越金牌线 13 分,实现了全球首个在 IMO 官方评卷中获得满分的模型。此外,Anthropic 的数学模型 Fble 5 已证明了雅可比猜想的反例。

twitter关注列表2026-07-22#模型发布#技术突破#研究
观察