一句话判断
该论文提供了可复现的BGPD流程和具体量化评估,适合需要处理大型代码库的编码代理开发团队参考。
核心信息
Harness Handbook论文提出使用静态分析和LLM辅助的BGPD流程,构建从运行时行为到源码位置的映射,在60个修改请求上规划胜率从28.3%提升至38.3%和从26.7%提升至45.6%,规划器token使用下降12.7%和8.6%,文件级和符号级F1在24个对比中全面优于GPT-5.5和Opus 4.8参考计划,定位失败减少最多25.9个百分点。
原始内容
相关动态
Introducing the Qwen-Audio-3.0-TTS.
阿里巴巴推出了 Qwen-Audio-3.0-TTS 文本转语音模型,提供实时版和高质量版两个版本,支持细粒度标签控制、自然语言指令、16 种语言、noise 鲁棒输出,最长 3 分钟长语音,并已登顶 Artificial Analysis TTS 排行榜。
红点笔记模型获 IMO 完美分数
RedNote 的 dots‑note‑3.0 AI 模型在国际数学奥林匹克赛中得满分 42/42,超越去年 DeepMind 和 OpenAI 的 35/42,且仅有 7 名 666 名人类选手匹配。该模型仍在 beta,为 dots3 系列中最小的变体,公司承诺日后开源。
GPT-5.6 Sol解决6个Erdős问题
一位研究员使用GPT-5.6 Sol在5天内解决了6个开放Erdős问题(尝试13个,成功率46%)。他采用合同式提示,明确证明要求、排除弱结果,并指定搜索策略,包括同时探索多种路径和对抗性检查。
Copy Less, Ground More: Overcoming Repetitive Copying in Long-Context Reasoning via Evidence-Aware Reinforcement Learning
研究人员发现,即使在强推理模型中,长上下文下模型会无差别复制输入文本的惰性,导致准确率下降。他们提出一种基于证据感知的强化学习奖励机制,通过惩罚复制无关内容、奖励关注关键文本,将准确率提升最多4.6个百分点。
Devin 破解三个未解决数学猜想
Devin(AI编程助手)在一天内破解三个未解决数学猜想:驳斥了开放约40年的Graffiti猜想154,证明了同样开放约40年的Graffiti猜想39和40,并驳斥了开放约20年的Brandt's Regular Supergraph Problem。