Signal Brief

Thariq Shihipar 演讲:解除Claude束缚与找到未知

Anthropic Claude Code工程师Thariq Shihipar在AI Engineer World's Fair演讲中提出“解除Claude的束缚”概念,认为模型能力需通过工具调用释放,并透露Claude Code已砍掉80%系统提示词;同时分享“找到未知”方法论,包括盲区扫描、多原...

twitter关注列表 宝玉 (@dotey) 发布 2026-07-07 收录 2026-07-07 观察

一句话判断

新增了Claude Code减少80%系统提示词的具体做法,以及通过工具化方法释放模型能力的反直觉结论,值得点开原文获取实操细节。

核心信息

Anthropic Claude Code工程师Thariq Shihipar在AI Engineer World's Fair演讲中提出“解除Claude的束缚”概念,认为模型能力需通过工具调用释放,并透露Claude Code已砍掉80%系统提示词;同时分享“找到未知”方法论,包括盲区扫描、多原型生成等具体做法。

原始内容

视频中举的宝可梦的那个例子,说大语言模型找不出哪些宝可梦的名字以 aw 结尾,然后有网友就像挑战一下通过提示词让大模型推导出来。 但这个例子的重点不是说如何改进提示词,而是要让模型学会调用工具。 就好比你问模型现在几点了,无论你怎么优化提示词,模型也不可能答出来,但是你给它工具可以获取当前时间,它就能正确回复。 > **引用原帖 宝玉 (@dotey):** > Anthropic Claude Code 工程师 Thariq Shihipar 上周在 AI Engineer World's Fair 上做了一场关于 Fable 5 的演讲。 > 他提了四个主题,最有信息量的是前两个。 > 第一个叫“解除 Claude 的束缚”(unhobbling Claude)。 > 他的核心观点是,模型的能力是在使用过程中逐步摸索出来的,很难一开始就设计出来的,所以模型变强的方式往往出人意料。 > 举例来说:你问聊天模型哪些宝可梦的名字以 aw 结尾,它答不上来,因为它虽然知道所有宝可梦的名字,但没法在脑子里一个一个过。但如果你给它代码执行工具,它会去拉全部宝可梦列表然后写脚本过滤,两秒钟就能找出答案。 > Anthropic 内部把这叫“能力悬余”(capability overhang),模型其实已经能做很多事,只是我们还没找到正确的打开方式。 > Claude Code 最近一个关键变化是砍掉了 80% 的系统提示词。早期模型需要详细的指令和大量示例,但 Fable 这个级别的模型反过来了,给太多示例反而会限制它,因为它自己的想象力比你给的示例更丰富。新的做法是给上下文,不给约束;告诉它情况,不告诉它不许做什么。 > 第二个主题叫“找到你的未知”。 > 你写给模型的提示词就像是“地图”,但真正的代码库和现实世界是“领地”。模型在领地里碰到地图上没标注的东西,就是一个未知数,就得自己做决定。Fable 5 的活动范围太大了,如果你不提前搞清楚这些未知数,它会在你没想到的地方做出你不想要的决策。 > 他给了几个具体方法: > 让 Fable 做一次“盲区扫描”(blind spot pass),在动手之前先通读相关代码,帮你找出你自己都不知道的潜在问题。 > 让它一口气做四个风格完全不同的原型,这样你可以通过反应来发现自己的偏好,而不是先想清楚再描述。 > 让它提问你,通过提问把你脑子里那些"知道但没写下来"的细节挖出来。 > 给它一段别的系统里的代码当参考地图,比直接写规格说明书更高效。 > 让它在执行过程中记录每个偏离你预期的决策点,事后你能看到它在哪些地方遇到了你没考虑到的问题。 > 最后让它反过来考你,确保你理解它做了什么,这样你在提 PR 的时候能说清楚发生了什么。 > 演讲的后半段内容就偏感性了,有点像@onevcat 写的那篇《当编程变得不再有趣》 https://t.co/AKtlV7h0ED。 > 他说第一次用 Fable 的时候,既觉得获得了很多,也觉得失去了什么。他以前开过一家三十人的 YC 创业公司,当时团队因为写代码太难,被迫在各种功能之间做取舍。几周前他回去看那个代码库,用 Fable 几小时就做完了当年要花好几周的事。他真的很喜欢手写代码时那种在脑子里旋转整个代码库的感觉,但也记得那些熬夜调 bug、项目一个接一个失败的日子。 > 他最后的建议是“打破常规”(be unreasonable)。 > 以前做取舍是本能,好、快、省三选二,现在他觉得这套逻辑该被推翻了:与其先设好优先级排除掉一部分,不如逼一下现实,看它是不是真的会逼你二选一。他演讲前一天花四个小时用 Fable 做完了这场演讲的全部 PPT。 > https://x.com/dotey/status/2074255513353642090

相关动态

01

Kimi K3 在 SpreadsheetBench 2 上排名第一

Kimi K3 在 SpreadsheetBench 2 基准测试中排名第一,超越 Claude Fable 5,完成 34.8% 的 workflow 任务。该基准测试涉及 321 个专家策划任务,平均每个任务包含 11.8 个工作表和 593.5 个单元格更改,聚焦于完整的电子表格工作簿执行。

twitter关注列表2026-07-18#模型#技术突破#评测
观察
02

Mind Lab 开源长文本强化学习项目

Mind Lab 开源了一个长文本强化学习(RL)项目,支持 2M tokens 的长上下文。相比以往需要数千个 GPU 的 1M 上下文研究,该项目仅需 8 个 GPU 即可完成,大幅降低了超长上下文研究的算力门槛。

twitter关注列表2026-07-17#开源#技术突破#模型
观察
03

Kimi K3非对称竞争分析

Kimi K3在Arena前端/WebDev人类盲测中以1679 Elo排名第一,领先Fable 5(1631)和GPT-5.6 Sol(1618),但在综合智能指数中仅排第四(57.1分),落后Fable 5(59.9)和GPT-5.6 Sol(58.9)。K3定价15美元/百万输出tokens,远低于Fable 5的50美元,并计划7...

twitter关注列表2026-07-18#AI#模型#技术突破
观察
04

开源模型长期网络能力差距缩小至4-7个月

长期网络能力方面,领先开源模型落后闭源前沿从2025年大部分时间的6-10个月缩短至4-7个月。GLM-5.2匹配了约4个月前发布的闭源模型。AI安全研究所的32步“The Last Ones”任务中,GPT-5.6 Sol在10次尝试中完成7次,每次预算1亿token,且性能随推理token增加而提升。

twitter关注列表2026-07-17#模型#技术突破#AI安全
观察
05

Runway Agent 在第三方评测中全面领先

Physion Labs 发布 Physion-Arc 1.0 基准测试,对 Runway、Luma、MiniMax、Kling、Utopia 和 TapNow 六款 AI 视频代理进行独立人类评估,使用 30 个电影提示和 16 个指标。Runway Agent 2.0 在叙事连贯性、电影语言和制作质量三项核心维度全部排名第一。

twitter关注列表2026-07-17#评测#多模态#模型
观察