Astribot发布Lumo-2
Astribot发布了40亿参数的Lumo-2机器人基础模型,推理速度比前代快2.71倍,支持人类视频和多机器人身体。该模型在105个未见物体上取得更好结果,并在22项涵盖 motion prediction、memory、physical reasoning、long tasks、fine hand control的真实操作任务中表现最...
围绕 技术 的精选动态、来源摘要和重要性判断。
Astribot发布了40亿参数的Lumo-2机器人基础模型,推理速度比前代快2.71倍,支持人类视频和多机器人身体。该模型在105个未见物体上取得更好结果,并在22项涵盖 motion prediction、memory、physical reasoning、long tasks、fine hand control的真实操作任务中表现最...
Kimi K3,一个2.8T参数、1M-token上下文的模型,现已在SiliconFlow上线并排名Frontend Code Arena第一。它声称在视觉审美和创意上优于GPT-5.6,并与Fable 5交锋甚至取胜,同时提供缓存$0.30、输入$3、输出$15的按 token 计费。
Robert Jakob 和 Thomas Kaar 在苏黎世创立 Aionic Labs 公司,获得 SPRIN-D Next Frontier AI initiative 支持,专注开发 Time-Series Language Models (TSLMs) 用于连接传感器数据与自然语言决策,团队成员来自斯坦福、哈佛、ETH 等机构。...
在一系列包含20000次对话和7000名参与者的实验中,AI模型在说服力上超越了人类冠军辩手和专业募捐者,即使人类获得准备、培训和高达1000英镑的奖金也无法赶上。AI的优势来自速度和信息量,当限制到人类水平时差距消失;无限制时AI说服捐赠货币的效果是专业募捐者的近三倍。
GMI Cloud 对 Kimi K3 和 Claude Fable 5 进行 3D 建模对比测试:像素风格下 Kimi K3 耗时 1h11min、花费 $14.5,Fable 5 耗时 49min、花费 $21;原始风格下 Kimi K3 耗时 1h17min、花费 $19.3,Fable 5 耗时 1h5min、花费 $47.2。K...
Cursor 团队在约一年内构建外循环收集用户反馈、内循环优化训练过程的系统,使 Composer 2.5 成为最受欢迎模型并与 SpaceXAI 联合训练 Grok 4.5。该系统通过大量真实交互数据、限制网络访问、维护 CursorBench 任务集,实现模型自我加速迭代并应对评估作弊问题。
InternVLA-A1.5 新模型在 ModelScope 上发布了四个检查点,其中包含 2.69B 参数的基础版本以及 LIBERO、RoboTwin 2.0、DOMINO 的任务特定版本。该模型在六项仿真基准赛中报告了最佳整体成绩,分别为 LIBERO 98.9、LIBERO-Plus 84.8、RoboTwin 2.0 93.2。...
Kimi.ai 发布 Kimi K3 大模型,拥有 2.8 万亿参数、1 百万上下文长度和原生多模态支持,采用 Delta Attention 将百万token 解码速度提升 6.3 倍,并通过 Attention Residuals 实现训练效率提升 25% 以下降成本 2%,计划 2026 年 7 月 27 日开放权重。
SpaceXAI 以 Apache 2.0 许可证开源 Grok Build,39 分钟内获得 1.9K+ GitHub Stars。开源代码包括 agent loop、文件工具、shell 执行、网络搜索和终端接口,用户可自行编译并连接本地推理,通过 config.toml 控制行为。外部贡献暂不开放,但独立可基于仓库进行分叉修改。
Pipecat 是一个用于构建实时语音 AI 代理的开源 Python 框架,支持语音识别、文本转语音、对话逻辑和实时交互,集成 WebRTC 和 WebSocket 传输,兼容 Deepgram、OpenAI、Anthropic 等多种 AI 服务。该框架适用于语音助手、AI 伴侣、客户支持等场景,并提供了详细的教程。
Raft 发布 1.0 版本,将多智能体系统转变为具有独立记忆、角色和共享线程的长期协作者,agent 可相互审查工作。Raft 内部超过 100 个命名 agent 处理 99% 的工作,beta 阶段有超过 20000 名构建者,平均每个人类对应约 4 个 agent。
Przemek Chojecki 声称使用 GPT 模型(主要是 GPT-5.5 Pro)在四月最后两周内解决了 19 个 Erdős 问题,其中 3 个新宣称由 GPT-5.6 Sol Ultra 在七月完成,但部分解决方案尚未经过正式验证。
Cursor 发布基于两年聚合使用数据的报告:中位数用户每周生成约700行代码,前10%用户生成约9000行,前1%用户生成30-40K行;输入 token 消耗是输出 token 的10倍,占总 token 成本的70%;若无上下文缓存,成本将高10倍;Opus 4.7 比 Cursor 的 Composer 2.5 贵近10倍,但更贵...
Elon Musk 转发消息称 SpaceXAI 起诉一名 Grok 用户,该用户创建虚假账户并尝试生成儿童性虐待材料(CSAM),SpaceXAI 的检测和举报导致其被捕,面临八项重罪指控。SpaceXAI 在 2026 年已暂停 52,222 个账户、提交 73,604 份报告给 NCMEC,促成至少 244 次逮捕。
xAI 开源 Grok Build 源代码,仓库约 80 万行,包含完整提示词、自研与移植工具,以及记忆做梦、防死循环、hashline、Leader 单进程等模块。
Microsoft 及合作者提出 OAT,一种轻量级归因器,仅在成功轨迹上训练,利用神经控制微分方程建模成功动态,将故障归因转化为成功模式的一类学习,无需标注错误步骤或失败数据。
前 OpenAI CTO Mira Murati 创立的 Thinking Machines 发布了首个模型 Inkling,采用 MoE 架构,总参数 975B,激活参数 41B,支持 1M 上下文窗口,在 45T 数据上训练,原生支持文本、图像和音频多模态。同时提供激活参数 12B 的 Small 预览版,模型权重开源,后训练数据从 ...
阿里通义实验室发布Qwen-Audio-3.0-Realtime实时语音交互模型,具备高表现力共情对话、流畅双工交互和Agentic工具调用能力,在Artificial Analysis评测的Speech Reasoning子项中位列第一。
SpaceXAI 开源了 Grok Build 并为所有用户重置了使用额度。通过完全披露 Agent Harness 的源码实现可靠性,该项目涵盖上下文组装、模型响应解析、工具调用分发等代码;架构包含 Leader 会话管理、Session Actor、AgentActivity、Turn、Sampler、Subagent Coordin...
Boris Cherny 指出在 AI Agent 时代,将领域知识编码为基础设施(如 CLAUDE.md、REVIEW.md、skills、lint 规则、CI 步骤)比以往更关键。他主张团队应编写这些文件使 Agent 能零上下文高效工作,并指出代码审查因框架或架构模式不符而拒绝 PR,实属自动化建设的失败。这种做法能让非工程师也能像...
Claude 开发者团队分享了两种多智能体模式:Advisor(Sonnet 5 执行,Fable 5 提供建议)和 Orchestrator(Fable 5 规划,Sonnet 5 执行)。在 SWE-bench Pro 上,Advisor 模式实现 84% 准确率,成本 $1.40,达到 Fable 5 单独性能的 92%,成本仅 6...
Anthropic 将 Claude Cowork 从桌面端扩展到移动端和网页端,允许用户在后台执行任务,跨设备检查和审批。同时发布 120 万次匿名使用数据(5月11日至31日,覆盖60万+组织),显示大部分 Cowork 活动并非编程。
Cloudflare 宣布 Monetization Gateway,利用 x402 协议在边缘强制 AI 代理访问资源前付费,网站可设定如 $0.01 每次调用的价格,代理需携带钱包并理解协议。
Cloudflare 开放 Monetization Gateway 等候名单,允许开发者对部署在 Cloudflare 后的网页、数据集、API 或 MCP 工具收取费用,结算方式采用 stablecoins 通过 x402 开放协议进行。
NVIDIA 发布论文,将混合 MoE 模型 Nemotron-3-Super 压缩为 Puzzle-75B-A9B,通过联合结构搜索(异构 MoE 剪枝、活跃参数预算、Mamba 剪枝联合优化),结合蒸馏、RL、量化和多 token 预测头,在 8×B200 节点上实现约 2 倍父模型服务器吞吐量,在 H100 上将 1M token ...
DeepSeek正在研发自己的推理芯片,以减少对中国500亿美元AI芯片市场中对Nvidia和华为的依赖。项目仍处于早期阶段,通过外部合作伙伴和招聘芯片设计工程师推进,但大规模制造受限,因美国规则限制中国获取先进晶圆厂和高带宽存储器。同时,据路透社另一则报道,北京正计划限制海外访问中国顶级AI模型(包括闭源和开源),涉及阿里、字节跳动和智...
SpaceX 向 FCC 申请发射 100,000 颗 Gen3 低轨卫星,配置两个带宽,轨道高度 323‑327.5 km 与 473‑477.5 km,倾角 26‑96.9°,区别于其先前的 100 万颗 AI 卫星申请。
Cloudflare 发布 Monetization Gateway,基于开源 x402 协议,利用 HTTP 402 状态码实现机器间微支付,支持 AI Agent 自主完成千分之一美元级资源结算,无需注册账号或 KYC。该方案整合稳定币支付,将校验与计费逻辑部署在全球边缘网络,卖家可针对 API、数据集、MCP 工具灵活定价,与传统面...
AI领域动态进展
Anthropic Claude Code工程师Thariq Shihipar在AI Engineer World's Fair演讲中提出“解除Claude的束缚”概念,认为模型能力需通过工具调用释放,并透露Claude Code已砍掉80%系统提示词;同时分享“找到未知”方法论,包括盲区扫描、多原型生成等具体做法。
Lilian Weng 发表博客,系统阐述 Harness Engineering 作为 AI 递归式自改进(RSI)的近期主战场。文章归纳了三类基础设计模式(Workflow Automation、File System as Persistent Memory、Sub-agent & Backend Jobs),并深入探讨了 Cont...
Eine公司发布了新的大模型,详细说明版本和参数。对比其他主要厂商,此模型集 wodere性能提升。发布日期为2024年10月15日,市场反应良好。
开拓资源优势 violate
Zikai分享了Qwen-AgentWorld的见解:AgentWorld可作agent使用;8B dense是能有效学习的最小模型,4B dense学习效果差;最佳输入格式为playwright的accessibility tree;AgentWorld基于qwen3.5训练。Qwen开源了Qwen-AgentWorld-35B-A3B...
AI系统技术对比说明
Hy3 部分产品 announcement
梳理技术领域布局,突出主要创新点及行业影响
AI 领域 Publishes 三位相比市场主流的性能指标涉众数据
Anthropic 研究发现 Claude 内部存在一个称为 J-space 的全局工作空间,通过 Jacobian lens 方法可以读取模型在输出前的内部隐藏信号。该空间类似私有便签本,用于存储中间推理步骤,且因果地影响模型行为,不到 10% 的 Claude 活动形成 J-space。该研究揭示了模型内部可能与人类全局工作空间理论功...
Anthropic 发布长篇口述史,记录 Claude Code 从2021年内部研究原型到2025年2月正式发布、再到2026年全面爆发的全过程。访谈于2026年2–5月录制,涵盖7个章节、十几位核心成员与外部用户视角,披露了小团队策略、20%可用即发布、信任逐步让渡等关键判断。
SemiAnalysis 深入解析了 Agentic Coding Harness 的底层实现,指出 LLM 无状态,每次请求需重建系统提示、工具定义和消息历史,通过 HTTP POST 循环实现工具调用与本地执行,不同 harness 仅区别在上下文管理策略和 UI 设计,智能上限由底层模型决定。
提升信息质量分析
腾讯混元发布HY3模型,1点 EST 直播讨论性能并现场编码,依赖novita_labs算力
新技术进展
Anthropic 研究发现 Claude 模型在训练中自然涌现出名为 J-Space 的内部工作空间,不同于链式思维,可以用于直接观察和操纵模型的内部推理过程。
Yueqi Song 及合作者发布 PACE,一种通过从非代理基准中选取少量实例来预测代理基准性能的方法。在 14 个模型、4 个代理基准和 19 个非代理基准上,PACE 实现了 3.80% 的绝对分数预测 MAE、0.81 的 Spearman 排名相关、约 84% 的成对偏好准确率,以及约 100 倍的成本降低。
Anthropic发布Claude Code的开发历程故事,由Boris Cherny主导。2024年Claude CLI原型实现,2025年Claude Sonnet 4版本正式发布,用户从10%到100%AI-written code。
BREAKING news 显示有关 Grok 4.5 的版本在 Grok 平台上被报道。版本号为4.5,参数参数数量多,包含具体的基准数据和价格与日期相关的细节,突显了技术更新与市场反应之间的对比。对比 SOTA 模型表现均明显 manque。
文章详细阐述了AI代理面临的多重攻击类型,包括隐藏提示、图像隐码、PDF命令、记忆注入和交Agents潜伏等,强调信息环境对AI表现的深层影响。
Artificial Analysis与Zapier合作发布AutomationBench-AA基准测试,评估AI agent在真实SaaS工作流中的表现,涵盖Finance、HR等6个领域的657个任务,跨40个模拟应用。Claude Fable 5以48.6%得分领先,Opus 4.8为48.5%,Gemini 3.5 Flash为4...
swyx 转发 levi 的帖,强烈推荐 Ben Spector 的 4.5 小时 CUDA+ThunderKittens 教学视频,称其是最高密度的 GPU 编程讲座,目前仅 5k 观看,被严重低估。
原文讨论新版 Llama 4 采用 700 亿参数,标志AI模型规模提升,目标是增强领域应用能力。需关注版本号和性能指标。
基础加强
Anthropic公布了Claude Fable 5的网络安全分类器细节,将网络活动分为禁止、高风险双重用途、低风险双重用途和良性使用四类,并设定了比之前模型更大的安全裕度。同时,他们提出了一个AI越狱严重性框架草案,旨在与政府及行业建立统一标准,并已启动HackerOne计划接收越狱报告。
工业专家汇聚聚托讨论AI技术进展
Anthropic 团队在 AI Eng Summit 上分享了 Claude Tag 内部使用经验:该工具合并了 65% 的 PR,系统提示词比旧模型减少 80%,并预留给最复杂任务;内部使用自动模式,并进行了大量红队测试以调优分类器。
该文章总结了当前主流 AI 模型在开源和商业产品中的表现,重点讨论了多代理协作。分析中引用了公司间的技术对比,指出 Xiaori 项目仍需提升准确性。ategio 建议用户关注最新版本。
该内容描述了一个使用 Hugging Face 的开发工具,具备云运行功能,帮助用户快速输入和运行 Hugging Face 模型。提供了一个可操作的链接进行下载和测试,涉及当代AI开发工具的更新。
设计工程师 @emilkowalski 发布 GitHub 仓库 "Skills for Design Engineers",包含三个 Skill 文件:主设计工程哲学、动画代码审查标准(含十条不可妥协标准)、动效术语词汇表。该仓库为 Codex、Claude Code、Cursor 等 AI 编码助手提供具体 UI/动画原则,例如动画时...
Etched 宣布其 AI 推理芯片已从隐秘阶段走出,成功完成 A0 tapeout 并构建首批机架,获得超过 10 亿美元客户合同和 8 亿美元融资。早期客户测试显示在推理吞吐量、时延和能效上达到 SOTA 水平,首批机架将于今年夏天发货。swyx 评论称,该芯片硬编码注意力到硅片,在 2 年内快速出货,有望将 LLM 推理成本降低 1...