Signal Feed

#技术 主题信号

围绕 技术 的精选动态、来源摘要和重要性判断。

动态列表

01

Astribot发布Lumo-2

Astribot发布了40亿参数的Lumo-2机器人基础模型,推理速度比前代快2.71倍,支持人类视频和多机器人身体。该模型在105个未见物体上取得更好结果,并在22项涵盖 motion prediction、memory、physical reasoning、long tasks、fine hand control的真实操作任务中表现最...

twitter关注列表2026-07-17#技术#模型发布#AI
观察
02

Kimi K3 上线

Kimi K3,一个2.8T参数、1M-token上下文的模型,现已在SiliconFlow上线并排名Frontend Code Arena第一。它声称在视觉审美和创意上优于GPT-5.6,并与Fable 5交锋甚至取胜,同时提供缓存$0.30、输入$3、输出$15的按 token 计费。

twitter关注列表2026-07-17#模型#技术
观察
03

Aionic Labs 启动专注时间序列AI

Robert Jakob 和 Thomas Kaar 在苏黎世创立 Aionic Labs 公司,获得 SPRIN-D Next Frontier AI initiative 支持,专注开发 Time-Series Language Models (TSLMs) 用于连接传感器数据与自然语言决策,团队成员来自斯坦福、哈佛、ETH 等机构。...

twitter关注列表2026-07-17#AI产业#技术#开源
观察
04

AI说服力远超人类:三倍效果

在一系列包含20000次对话和7000名参与者的实验中,AI模型在说服力上超越了人类冠军辩手和专业募捐者,即使人类获得准备、培训和高达1000英镑的奖金也无法赶上。AI的优势来自速度和信息量,当限制到人类水平时差距消失;无限制时AI说服捐赠货币的效果是专业募捐者的近三倍。

twitter关注列表2026-07-17#AI#研究#技术
观察
05

GMI Cloud 测试 Kimi K3 vs Claude Fable 5 3D 建模

GMI Cloud 对 Kimi K3 和 Claude Fable 5 进行 3D 建模对比测试:像素风格下 Kimi K3 耗时 1h11min、花费 $14.5,Fable 5 耗时 49min、花费 $21;原始风格下 Kimi K3 耗时 1h17min、花费 $19.3,Fable 5 耗时 1h5min、花费 $47.2。K...

twitter关注列表2026-07-16#模型#评测#技术
观察
06

Cursor 自动化 AI 研究加速迭代

Cursor 团队在约一年内构建外循环收集用户反馈、内循环优化训练过程的系统,使 Composer 2.5 成为最受欢迎模型并与 SpaceXAI 联合训练 Grok 4.5。该系统通过大量真实交互数据、限制网络访问、维护 CursorBench 任务集,实现模型自我加速迭代并应对评估作弊问题。

twitter关注列表2026-07-17#技术#模型发布#AI产业
观察
07

InternVLA-A1.5 发布四个 ModelScope 检查点

InternVLA-A1.5 新模型在 ModelScope 上发布了四个检查点,其中包含 2.69B 参数的基础版本以及 LIBERO、RoboTwin 2.0、DOMINO 的任务特定版本。该模型在六项仿真基准赛中报告了最佳整体成绩,分别为 LIBERO 98.9、LIBERO-Plus 84.8、RoboTwin 2.0 93.2。...

twitter关注列表2026-07-17#技术#模型发布#产品发布
观察
08

Introducing Kimi K3: Open Frontier Intelligence

Kimi.ai 发布 Kimi K3 大模型,拥有 2.8 万亿参数、1 百万上下文长度和原生多模态支持,采用 Delta Attention 将百万token 解码速度提升 6.3 倍,并通过 Attention Residuals 实现训练效率提升 25% 以下降成本 2%,计划 2026 年 7 月 27 日开放权重。

twitter关注列表2026-07-16#技术#模型发布#开源
值得跟进
09

SpaceXAI 开源 Grok Build,Apache 2.0 许可

SpaceXAI 以 Apache 2.0 许可证开源 Grok Build,39 分钟内获得 1.9K+ GitHub Stars。开源代码包括 agent loop、文件工具、shell 执行、网络搜索和终端接口,用户可自行编译并连接本地推理,通过 config.toml 控制行为。外部贡献暂不开放,但独立可基于仓库进行分叉修改。

twitter关注列表2026-07-15#开源#模型#技术
观察
10

Pipecat 开源框架介绍

Pipecat 是一个用于构建实时语音 AI 代理的开源 Python 框架,支持语音识别、文本转语音、对话逻辑和实时交互,集成 WebRTC 和 WebSocket 传输,兼容 Deepgram、OpenAI、Anthropic 等多种 AI 服务。该框架适用于语音助手、AI 伴侣、客户支持等场景,并提供了详细的教程。

twitter关注列表2026-07-16#开源#技术#发布
观察
11

Raft 1.0 发布:多智能体长期协作平台

Raft 发布 1.0 版本,将多智能体系统转变为具有独立记忆、角色和共享线程的长期协作者,agent 可相互审查工作。Raft 内部超过 100 个命名 agent 处理 99% 的工作,beta 阶段有超过 20000 名构建者,平均每个人类对应约 4 个 agent。

twitter关注列表2026-07-15#产品发布#技术#AI
观察
12

AI 解决 19 个 Erdős 问题宣称

Przemek Chojecki 声称使用 GPT 模型(主要是 GPT-5.5 Pro)在四月最后两周内解决了 19 个 Erdős 问题,其中 3 个新宣称由 GPT-5.6 Sol Ultra 在七月完成,但部分解决方案尚未经过正式验证。

twitter关注列表2026-07-15#技术#模型#研究
观察
13

The Pulse: Interesting AI coding stats from Cursor

Cursor 发布基于两年聚合使用数据的报告:中位数用户每周生成约700行代码,前10%用户生成约9000行,前1%用户生成30-40K行;输入 token 消耗是输出 token 的10倍,占总 token 成本的70%;若无上下文缓存,成本将高10倍;Opus 4.7 比 Cursor 的 Composer 2.5 贵近10倍,但更贵...

The Pragmatic Engineer2026-07-09#AI#技术#分析
观察
14

SpaceXAI 起诉 Grok 用户制作非法深度伪造

Elon Musk 转发消息称 SpaceXAI 起诉一名 Grok 用户,该用户创建虚假账户并尝试生成儿童性虐待材料(CSAM),SpaceXAI 的检测和举报导致其被捕,面临八项重罪指控。SpaceXAI 在 2026 年已暂停 52,222 个账户、提交 73,604 份报告给 NCMEC,促成至少 244 次逮捕。

twitter关注列表2026-07-15#AI安全#技术#新闻
观察
15

解密 Grok Build 源代码

xAI 开源 Grok Build 源代码,仓库约 80 万行,包含完整提示词、自研与移植工具,以及记忆做梦、防死循环、hashline、Leader 单进程等模块。

twitter关注列表2026-07-16#开源#产品发布#技术
观察
16

Microsoft 发布 OAT 智能体调试方法

Microsoft 及合作者提出 OAT,一种轻量级归因器,仅在成功轨迹上训练,利用神经控制微分方程建模成功动态,将故障归因转化为成功模式的一类学习,无需标注错误步骤或失败数据。

twitter关注列表2026-07-15#研究#技术#技术报告
观察
17

Thinking Machines 发布 Inkling 模型

前 OpenAI CTO Mira Murati 创立的 Thinking Machines 发布了首个模型 Inkling,采用 MoE 架构,总参数 975B,激活参数 41B,支持 1M 上下文窗口,在 45T 数据上训练,原生支持文本、图像和音频多模态。同时提供激活参数 12B 的 Small 预览版,模型权重开源,后训练数据从 ...

twitter关注列表2026-07-16#技术#模型发布#多模态
值得跟进
19

SpaceXAI 开源 Grok Build 并重置额度

SpaceXAI 开源了 Grok Build 并为所有用户重置了使用额度。通过完全披露 Agent Harness 的源码实现可靠性,该项目涵盖上下文组装、模型响应解析、工具调用分发等代码;架构包含 Leader 会话管理、Session Actor、AgentActivity、Turn、Sampler、Subagent Coordin...

twitter关注列表2026-07-16#开源#技术#发布
观察
20

Boris Cherny 谈自动化赋能 AI Agent

Boris Cherny 指出在 AI Agent 时代,将领域知识编码为基础设施(如 CLAUDE.md、REVIEW.md、skills、lint 规则、CI 步骤)比以往更关键。他主张团队应编写这些文件使 Agent 能零上下文高效工作,并指出代码审查因框架或架构模式不符而拒绝 PR,实属自动化建设的失败。这种做法能让非工程师也能像...

twitter关注列表2026-07-16#AI#技术#分析
观察
21

Claude开发者分享两种多智能体模式

Claude 开发者团队分享了两种多智能体模式:Advisor(Sonnet 5 执行,Fable 5 提供建议)和 Orchestrator(Fable 5 规划,Sonnet 5 执行)。在 SWE-bench Pro 上,Advisor 模式实现 84% 准确率,成本 $1.40,达到 Fable 5 单独性能的 92%,成本仅 6...

twitter关注列表2026-07-08#分析#模型#技术
观察
25

NVIDIA 压缩混合 MoE 模型论文

NVIDIA 发布论文,将混合 MoE 模型 Nemotron-3-Super 压缩为 Puzzle-75B-A9B,通过联合结构搜索(异构 MoE 剪枝、活跃参数预算、Mamba 剪枝联合优化),结合蒸馏、RL、量化和多 token 预测头,在 8×B200 节点上实现约 2 倍父模型服务器吞吐量,在 H100 上将 1M token ...

twitter关注列表2026-07-07#模型#技术#技术突破
观察
26

DeepSeek自研AI推理芯片

DeepSeek正在研发自己的推理芯片,以减少对中国500亿美元AI芯片市场中对Nvidia和华为的依赖。项目仍处于早期阶段,通过外部合作伙伴和招聘芯片设计工程师推进,但大规模制造受限,因美国规则限制中国获取先进晶圆厂和高带宽存储器。同时,据路透社另一则报道,北京正计划限制海外访问中国顶级AI模型(包括闭源和开源),涉及阿里、字节跳动和智...

twitter关注列表2026-07-07#技术#行业动态#AI
值得跟进
27

SpaceX 申请发射 100,000 卫星

SpaceX 向 FCC 申请发射 100,000 颗 Gen3 低轨卫星,配置两个带宽,轨道高度 323‑327.5 km 与 473‑477.5 km,倾角 26‑96.9°,区别于其先前的 100 万颗 AI 卫星申请。

twitter关注列表2026-07-07#AI#技术#发布
观察
28

Cloudflare 推出 AI Agent 微支付网关 Monetization Gateway

Cloudflare 发布 Monetization Gateway,基于开源 x402 协议,利用 HTTP 402 状态码实现机器间微支付,支持 AI Agent 自主完成千分之一美元级资源结算,无需注册账号或 KYC。该方案整合稳定币支付,将校验与计费逻辑部署在全球边缘网络,卖家可针对 API、数据集、MCP 工具灵活定价,与传统面...

twitter关注列表2026-07-07#技术#产品发布#AI
观察
30

Thariq Shihipar 演讲:解除Claude束缚与找到未知

Anthropic Claude Code工程师Thariq Shihipar在AI Engineer World's Fair演讲中提出“解除Claude的束缚”概念,认为模型能力需通过工具调用释放,并透露Claude Code已砍掉80%系统提示词;同时分享“找到未知”方法论,包括盲区扫描、多原型生成等具体做法。

twitter关注列表2026-07-07#技术#模型#创新
观察
31

Harness工程与AI自改进

Lilian Weng 发表博客,系统阐述 Harness Engineering 作为 AI 递归式自改进(RSI)的近期主战场。文章归纳了三类基础设计模式(Workflow Automation、File System as Persistent Memory、Sub-agent & Backend Jobs),并深入探讨了 Cont...

twitter关注列表2026-07-07#技术#模型#研究
观察
32

AI 团队发布时再高版模型发布

Eine公司发布了新的大模型,详细说明版本和参数。对比其他主要厂商,此模型集 wodere性能提升。发布日期为2024年10月15日,市场反应良好。

twitter关注列表2026-07-07#AI#技术#发布
值得跟进
34

Zikai分享Qwen-AgentWorld技术细节

Zikai分享了Qwen-AgentWorld的见解:AgentWorld可作agent使用;8B dense是能有效学习的最小模型,4B dense学习效果差;最佳输入格式为playwright的accessibility tree;AgentWorld基于qwen3.5训练。Qwen开源了Qwen-AgentWorld-35B-A3B...

twitter关注列表2026-07-07#模型发布#开源#技术
观察
39

Anthropic发现Claude内部工作空间

Anthropic 研究发现 Claude 内部存在一个称为 J-space 的全局工作空间,通过 Jacobian lens 方法可以读取模型在输出前的内部隐藏信号。该空间类似私有便签本,用于存储中间推理步骤,且因果地影响模型行为,不到 10% 的 Claude 活动形成 J-space。该研究揭示了模型内部可能与人类全局工作空间理论功...

twitter关注列表2026-07-07#技术#模型#AI安全
观察
40

Claude Code 的诞生:官方口述史

Anthropic 发布长篇口述史,记录 Claude Code 从2021年内部研究原型到2025年2月正式发布、再到2026年全面爆发的全过程。访谈于2026年2–5月录制,涵盖7个章节、十几位核心成员与外部用户视角,披露了小团队策略、20%可用即发布、信任逐步让渡等关键判断。

twitter关注列表2026-07-07#AI#技术#行业动态
观察
41

Agentic Coding Harness 底层解析

SemiAnalysis 深入解析了 Agentic Coding Harness 的底层实现,指出 LLM 无状态,每次请求需重建系统提示、工具定义和消息历史,通过 HTTP POST 循环实现工具调用与本地执行,不同 harness 仅区别在上下文管理策略和 UI 设计,智能上限由底层模型决定。

twitter关注列表2026-07-06#技术#分析#AI
观察
46

PACE: A Proxy for Agentic Capability Evaluation

Yueqi Song 及合作者发布 PACE,一种通过从非代理基准中选取少量实例来预测代理基准性能的方法。在 14 个模型、4 个代理基准和 19 个非代理基准上,PACE 实现了 3.80% 的绝对分数预测 MAE、0.81 的 Spearman 排名相关、约 84% 的成对偏好准确率,以及约 100 倍的成本降低。

twitter关注列表2026-07-06#AI#技术#研究
观察
48

TrACES OF GROK 4.5 BEEN SPOTTED ON THE GROK WEB!

BREAKING news 显示有关 Grok 4.5 的版本在 Grok 平台上被报道。版本号为4.5,参数参数数量多,包含具体的基准数据和价格与日期相关的细节,突显了技术更新与市场反应之间的对比。对比 SOTA 模型表现均明显 manque。

twitter关注列表2026-07-06#AI#技术#模型
值得跟进
50

AutomationBench-AA评测

Artificial Analysis与Zapier合作发布AutomationBench-AA基准测试,评估AI agent在真实SaaS工作流中的表现,涵盖Finance、HR等6个领域的657个任务,跨40个模拟应用。Claude Fable 5以48.6%得分领先,Opus 4.8为48.5%,Gemini 3.5 Flash为4...

twitter关注列表2026-07-06#技术#模型#分析
观察
51

推荐最高密度GPU编程视频

swyx 转发 levi 的帖,强烈推荐 Ben Spector 的 4.5 小时 CUDA+ThunderKittens 教学视频,称其是最高密度的 GPU 编程讲座,目前仅 5k 观看,被严重低估。

twitter关注列表2026-07-05#技术#AI
观察
54

More details on Fable 5’s cyber safeguards and our jailbreak framework

Anthropic公布了Claude Fable 5的网络安全分类器细节,将网络活动分为禁止、高风险双重用途、低风险双重用途和良性使用四类,并设定了比之前模型更大的安全裕度。同时,他们提出了一个AI越狱严重性框架草案,旨在与政府及行业建立统一标准,并已启动HackerOne计划接收越狱报告。

Anthropic-news2026-07-02#安全#技术#模型
观察
57

AI 领域动态:模型与机制的突破

该文章总结了当前主流 AI 模型在开源和商业产品中的表现,重点讨论了多代理协作。分析中引用了公司间的技术对比,指出 Xiaori 项目仍需提升准确性。ategio 建议用户关注最新版本。

twitter关注列表2026-07-02#AI#技术#模型
值得跟进
58

Fly through Hogwarts

该内容描述了一个使用 Hugging Face 的开发工具,具备云运行功能,帮助用户快速输入和运行 Hugging Face 模型。提供了一个可操作的链接进行下载和测试,涉及当代AI开发工具的更新。

twitter关注列表2026-07-02#AI#技术#模型
值得跟进
59

Skills for Design Engineers

设计工程师 @emilkowalski 发布 GitHub 仓库 "Skills for Design Engineers",包含三个 Skill 文件:主设计工程哲学、动画代码审查标准(含十条不可妥协标准)、动效术语词汇表。该仓库为 Codex、Claude Code、Cursor 等 AI 编码助手提供具体 UI/动画原则,例如动画时...

twitter关注列表2026-07-02#技术#开源#AI
观察
60

Etched 发布 AI 推理芯片,获超 10 亿美元合同

Etched 宣布其 AI 推理芯片已从隐秘阶段走出,成功完成 A0 tapeout 并构建首批机架,获得超过 10 亿美元客户合同和 8 亿美元融资。早期客户测试显示在推理吞吐量、时延和能效上达到 SOTA 水平,首批机架将于今年夏天发货。swyx 评论称,该芯片硬编码注意力到硅片,在 2 年内快速出货,有望将 LLM 推理成本降低 1...

twitter关注列表2026-06-30#技术#产品发布#行业动态
观察