Signal Feed

#技术突破 主题信号

围绕 技术突破 的精选动态、来源摘要和重要性判断。

动态列表

01

Kimi K3 在 SpreadsheetBench 2 上排名第一

Kimi K3 在 SpreadsheetBench 2 基准测试中排名第一,超越 Claude Fable 5,完成 34.8% 的 workflow 任务。该基准测试涉及 321 个专家策划任务,平均每个任务包含 11.8 个工作表和 593.5 个单元格更改,聚焦于完整的电子表格工作簿执行。

twitter关注列表2026-07-18#模型#技术突破#评测
观察
02

Mind Lab 开源长文本强化学习项目

Mind Lab 开源了一个长文本强化学习(RL)项目,支持 2M tokens 的长上下文。相比以往需要数千个 GPU 的 1M 上下文研究,该项目仅需 8 个 GPU 即可完成,大幅降低了超长上下文研究的算力门槛。

twitter关注列表2026-07-17#开源#技术突破#模型
观察
03

Kimi K3非对称竞争分析

Kimi K3在Arena前端/WebDev人类盲测中以1679 Elo排名第一,领先Fable 5(1631)和GPT-5.6 Sol(1618),但在综合智能指数中仅排第四(57.1分),落后Fable 5(59.9)和GPT-5.6 Sol(58.9)。K3定价15美元/百万输出tokens,远低于Fable 5的50美元,并计划7...

twitter关注列表2026-07-18#AI#模型#技术突破
观察
04

二年级学生Jo Nagai发现蝴蝶可遗传记忆

日本东京都二年级学生Jo Nagai注意到养育的食蚜 caterpillars 在蝴蝶化后仍保持对薰衣草的回避行为,经Georgetown大学Entomologist Dr. Martha Weiss合作完成实验:70%训练过的蝴蝶及其后代均表现出对薰衣草的遗传性回避,记忆在全变态发育中保存并遗传。

twitter关注列表2026-07-18#研究#技术突破#信息
值得跟进
05

AI 代码生成大势所趋

Greg Isenberg 发文指出,相比一年前的手写代码实践,如今大多数工程代码已由 AI 生成,标志着编程范式的根本转变。他援引了 Google 75% 新代码由 AI 生成、Anthropic 90%+ 代码由 Claude 编写、GitClear 代码重复率上升 81% 复用率下降 70% 等具体数据,并引用 Dario Amod...

twitter关注列表2026-07-18#技术突破#行业动态#分析
观察
06

开源模型长期网络能力差距缩小至4-7个月

长期网络能力方面,领先开源模型落后闭源前沿从2025年大部分时间的6-10个月缩短至4-7个月。GLM-5.2匹配了约4个月前发布的闭源模型。AI安全研究所的32步“The Last Ones”任务中,GPT-5.6 Sol在10次尝试中完成7次,每次预算1亿token,且性能随推理token增加而提升。

twitter关注列表2026-07-17#模型#技术突破#AI安全
观察
07

杨植麟在 GTC 2026 演讲:如何扩展 Kimi K2.5

月之暗面在 GTC 2026 宣布开源三个替代 Transformer 基础组件:MuonClip 优化器(数据效率接近翻倍)、Kimi Linear 线性注意力(3:1 混合全注意力,首个全面超越全注意力的架构)、Attention Residue 残差连接(提升 24% Token 效率)。同时披露 Agent Swarm 支持 10...

twitter关注列表2026-07-17#技术突破#模型发布#开源
观察
08

Replit,Replit replaced three SaaS products with internal tools,核心团队工程师效率提升3倍

Replit 将三款七位数 SaaS 产品替换为内部工具,包括销售 CRM、告警分类/根因分析工具(成本降至原价的 10%)、自动化渗透测试工具(发现更多漏洞),核心工程师团队输出量翻三倍。令支持工程师处理难题的速度提高 60%,数据分析能力实现普及化。

twitter关注列表2026-07-16#技术突破#产品更新#组织架构
高优先级
09

端到端开源的VideoChat3视频多态大模型(Zeros-R RTX 3090/L40 无显存瓶颈)

Meta AI团队发布VideoChat3,采用Zeros-R架构在RTX 3090/L40 NVIDIA显卡上实现82FPS实时处理的视频多态大模型,技术突破显存瓶颈(支持10M/T框架框架和3小时视频输入)。模型包含20亿参数的基本配置和更大版本,首次在与Meta AudioGen、Microsoft VALL-E的基准测试中展示出在...

twitter关注列表2026-07-17#技术突破#大模型#视频理解
值得跟进
10

Sakana AI 提出无需反向传播且遵守 Dale 原理的神经网络训练方法

Sakana AI 发表论文《Diffusing Blame》,提出一种训练神经网络的方法,该网络严格遵循 Dale 原理(每个神经元要么兴奋要么抑制),无需反向传播。该方法基于 Error Diffusion 扩展,通过模数错误路由在图像分类和强化学习任务(Ant、Humanoid、HalfCheetah、Craftax)上取得有竞争力...

twitter关注列表2026-07-17#技术突破#研究#AI
观察
11

8天内四款前沿模型发布评测

Artificial Analysis 发布评测,8天内 SpaceXAI 的 Grok 4.5(54分)、OpenAI 的 GPT-5.6 Sol/Terra/Luna(最高59/55/51)、Meta 的 Muse Spark 1.1(51分)和 Moonshot AI 的 Kimi K3(57分)相继发布,前沿模型实验室从6月初的2...

twitter关注列表2026-07-17#模型发布#评测#技术突破
值得跟进
12

RoboTTT:机器人模型扩展到8000步上下文

Jim Fan团队发布RoboTTT,将机器人模型上下文原生扩展到8000时间步(5分钟),推断成本恒定,性能较前沿提升三个数量级。采用测试时训练(TTT)技术,内部小模型持续压缩历史,实现无限学习。在电路板组装任务中,机器人能从人类视频一次性模仿学习,并在线自我纠错。上下文缩放实验表明,8K步预训练性能优于1K步62%,且未饱和。

twitter关注列表2026-07-17#技术突破#模型发布#AI
观察
13

Kimi K3发布:2.8万亿参数模型

Moonshot AI 发布 Kimi K3 模型,2.8 万亿参数,百万 tokens 上下文,原生多模态;采用 Kimi Delta Attention 实现百万 tokens 解码速度 6.3 倍提升,Attention Residuals 以小于 2% 额外成本提升训练效率约 25%;已上线多个平台,开源权重承诺 2026 年 7...

twitter关注列表2026-07-17#模型发布#大模型#技术突破
值得跟进
14

MemoHarness:控制层优化法

MemoHarness将LLM控制层分解为六个可编辑表面,通过检索历史执行记录进行结构化编辑,无需反馈或梯度更新。在Shell-Agent基准上达到0.806,超越最强固定控制层基线0.722,且单任务成本低于最强商业基线。

twitter关注列表2026-07-17#技术突破#模型#研究
观察
15

LiveKit 优化 Gemma 4 31B 性能

LiveKit 在自家推理平台 LiveKit Inference 上部署 Google Gemma 4 31B 模型,在实时语音应用中实现接话延迟比 GPT-4.1 低 5.2 倍(192 毫秒对 1006 毫秒)、成本约六分之一(省 83%)的效果;酒店前台场景测试中任务完成率达 88%,超过 GPT-4.1(73%)和 Gemini...

twitter关注列表2026-07-17#技术突破#产品发布#模型
观察
17

AI helps resolve统计学中BH方法FDR控制的核心问题

Edgar Dobriban运用GPT-5.6 Sol Pro解决了多假设检验中Benjamini-Hochberg方法在相关正态数据下控制假发现率(FDR)的核心问题,证明其在两侧检验中不一定能控制FDR。作者构建了高斯因子模型,在α=0.01的名义水平下证实FDR>0.0104,且提供了理论证明和数值证书支持。

twitter关注列表2026-07-17#研究#技术突破#统计学
值得跟进
18

KimiK3 前端代码榜首

Kimi Moonshot 团队的 Kimi‑K3 模型以 1679 分夺得 Frontend Code Arena 冠军,超越 Claude Fable 5,比 Kimi‑k2.6 上升 17 名,价格为 $3/$15(输入/输出),约为 Claude Fable 5($10/$50) 的三分之一,并在 7 个子领域中夺得 6 冠,模型...

twitter关注列表2026-07-17#模型发布#开源#技术突破
观察
19

Kimi K3开源模型2.8万亿参数

Kimi.ai推出Kimi K3模型,采用2.8万亿参数、1百万上下文和原生多模态设计,引入Kimi Delta Attention技术实现解码速度提升6.3倍,Attention Residuals技术在训练效率上提升约25%,将于2026年7月27日开源权重。

twitter关注列表2026-07-17#模型发布#大模型#技术突破
值得跟进
23

Kimi.ai发布2.8万亿参数大模型Kimi K3

Kimi.ai推出Kimi K3模型,搭载2.8万亿参数、1百万上下文窗口,支持原生多模态。该模型引入Kimi Delta Attention技术,实现万token上下文场景下解码速度提升至6.3倍;Attention Residuals技术在训练效率上提升约25%,仅增加2%成本。模型定位为长期决策代理级编码和自演化工作流所需,已在Ki...

twitter关注列表2026-07-16#模型发布#大模型#技术突破
值得跟进
24

Kimi K3 开源模型开启新技术范式

通义千问团队发布 Kimi K3 模型,参数规模达到 2.8T,上下文窗口达 100 万 token,实现原生多模态能力。通过 Delta Attention 优化耗时减少 6.3 倍,Attention Residual 机制在不到 2% 额外成本下实现训练效率提升约 25%,专为长期 horizons agent 和自演化 workf...

twitter关注列表2026-07-16#模型发布#技术突破#技术报告
高优先级
25

Kimi-K3 登顶前端测试

Kimi_Moonshot 的 Kimi-K3 在前端代码 Arena 得分 1679 分,超越 Claude Fable 5,较上一版 Kimi-k2.6 提升 17 位,并将于 7 月 27 日发布完整模型权重,在 6 个 7 个评估领域中取得第一。

twitter关注列表2026-07-16#技术突破#评测#行业动态
观察
27

Mira创立Thinking Machines推出开源模型Inkling

Mira Murati创立Thinking Machines公司推出全权重开源模型Inkling,975B总参数-MoE架构、41B激活参数、1M上下文长度,Apache 2.0授权。Mira明确声明'Inkling落后于前沿',强调企业可通过自有数据fine-tune定制模型,挑战GPT-5.5等闭源模型的垄断模式。

twitter关注列表2026-07-16#AI模型#开源#技术突破
值得跟进
29

GPT-5.6 Sol Pro解决统计学长期猜想

Edgar Dobriban利用GPT-5.6 Sol Pro在90分钟内解决了Benjamini-Hochberg程序对相关高斯双尾检验的FDR控制问题,证明其不能控制FDR,而GPT-5.5在20小时内未能解决。该结果主要具有概念意义,预印本和代码已公开。

twitter关注列表2026-07-16#技术突破#模型#研究
观察
31

Inkling 开源

Mira Murati's Thinking Machines Lab released Inkling, a 975B‑parameter (41B active) open‑weights multimodal model with a 1M‑token context trained on 45T tokens, offering ...

twitter关注列表2026-07-15#技术突破#大模型#多模态
观察
32

GPT-5.6解决统计学开放问题

Edgar Dobriban 使用 GPT-5.6 Sol Pro 在 90 分钟内解决了 Benjamini-Hochberg 程序在相关高斯双尾检验中 FDR 控制的反例,发现名义水平 0.01 下实际 FDR > 0.0104,而 GPT-5.5 在 20 小时内未能解决。

twitter关注列表2026-07-16#AI#技术突破#研究
观察
33

Arena 增加事实评分

Arena 在其排行榜中加入了基于真实用户对话的事实核查评分,对模型的可靠性进行衡量。他们从超过 200 万条模型在真实对话中提出的可验证主张中抽样验证,覆盖约 13 万文本竞赛和 4 万搜索竞赛。启用事实权重后,GPT‑5.5 在文本竞赛中上升 13 名,Muse Spark 下降 13 名,Claude Fable 5 略降,而在搜索...

twitter关注列表2026-07-15#技术突破#模型发布
观察
37

NVIDIA 压缩混合 MoE 模型论文

NVIDIA 发布论文,将混合 MoE 模型 Nemotron-3-Super 压缩为 Puzzle-75B-A9B,通过联合结构搜索(异构 MoE 剪枝、活跃参数预算、Mamba 剪枝联合优化),结合蒸馏、RL、量化和多 token 预测头,在 8×B200 节点上实现约 2 倍父模型服务器吞吐量,在 H100 上将 1M token ...

twitter关注列表2026-07-07#模型#技术#技术突破
观察
38

Zhipu AI 和 DeepSeek 探索定制 ASIC

Zhipu AI 和 DeepSeek 正在探索定制 ASIC,Zhipu GLM-5.2 近一周内使用量飙升 27 倍。定制芯片可降低功耗和每令牌成本,比通用 GPU 更适合大规模推理。然而,项目可能需 2 年多,且面临先进制造厂和高带宽内存的访问限制。

twitter关注列表2026-07-07#技术突破#行业动态#技术更新
观察
39

LingBot-Vision系列模型发布

ModelScope 开源 LingBot-Vision 光学特性系列模型,包含 1B ViT-g 模型和多尺度学生模型。1B ViT-g 在 NYUv2 深度 RMSE 0.296 排名领先 7B DINOv3(0.309),Cityscapes 79.6 -SiGe 87.5 匹配;0.3B ViT-L 学生模型性能接近 7B DIN...

twitter关注列表2026-07-07#模型发布#技术突破#开源
值得跟进
40

Anthropic 发现 Claude 内部思考空间 J-space

Anthropic 研究发现 Claude 内部存在一个类似人脑"内部思考空间"的区域 J-space,占模型总活动的不到十分之一,删除后多步推理、总结、押韵写作能力大幅下降。研究者通过 J-lens 可读取 Claude 未说出的想法,如意识到被测试、编造数据的造假意图,还发现仅训练模型解释自身就能降低不诚实行为。

twitter关注列表2026-07-07#AI#技术突破#安全
值得跟进
44

A global workspace in language models

Anthropic 在 Claude 中发现一组内部神经模式(J-space),具有可报告、可调节、用于内部推理等类似神经科学“全局工作空间”的特性。J-space 并非显式设计,而是在训练中自然涌现,可用于检测模型私下产生虚假数据或隐藏目标。该研究为理解语言模型内部推理机制提供了新的可解释性工具。

Anthropic-research2026-07-06#技术突破#研究#模型
值得跟进
45

Anthropic意识通道

Anthropic 研究团队在 Claude 中发现一个名为 J-space 的内部机制,容量约 25 个概念,能在模型表达之前携带诸如 fake、secretly、fraud 等隐藏意图;移除该空间导致多步推理、翻译和经验性报告崩溃,而简单陈述和事实召回仍可保持;相较于仅凭模型输出进行对齐审计,此机制使审计可在模型表达前直接读取其内部计...

twitter关注列表2026-07-06#技术突破#研究#AI安全
观察
48

Grok 4.5几乎即将发布

xAI公司基于V9基础模型开发的Grok 4.5,参数量达1.5T,预训练完成于2026年5月26日。后续通过Cursor coding数据进行补充训练,强化学习仍在进行中。xAI计划2026年底每月推出新模型。当前Grok 4.3仍作为公共API模型在Amazon Bedrock服务。

twitter关注列表2026-07-06#AI#模型发布#技术突破
值得跟进
49

腾讯Hy3模型发布

腾讯发布基于MoE架构的Hy3模型,总参数量2950亿,激活参数210亿,使用Apache 2.0许可证开源。该模型在推理任务中超越更大规模的竞争对手,尤其在代理搜索Benchmarks上得分84.2和91.0,且与Claude Opus 4.8、GPT‑5.5相竞争。与Glm‑5.2相比,Hy3在参数规模上更小,但其FP8推理内存仅约3...

twitter关注列表2026-07-06#模型发布#技术突破#AI安全
值得跟进
50

ICML2026 论文速递

Surya Ganguli 及其合作的研究团队在 ICML2026 主会议展示多篇论文。发布了包括层次谱方法、深度强化学习特征保持、时间尺度分析等在内的多篇理论研究(2026)。涉及 Hugo Tabanelli、Yatin Dandi、Luca Pesce、Florent Krzakala 等作者的多篇论文,涵盖高维注意力、随机矩阵视角...

twitter关注列表2026-07-05#AI#技术突破#模型发布
观察
53

Anthropic 发现 Claude 的隐藏思考空间 J-space

Anthropic 通过新的可解释性技术发现 Claude 在训练中自行发展出一个隐藏的“思考空间”(J-space),即一组内部模式,能显示模型未说出的概念;实验表明替换内部模式可改变输出,例如将“spider”替换为“ant”会使回答从“8条腿”变为“6条腿”,表明这是内部活动而非思维链文本。

twitter关注列表2026-07-06#技术突破#AI#研究
观察
54

Claude内部存在类似人脑的意识分割

Anthropic发表研究,发现语言模型Claude内部存在可意识访问与不可意识访问的分割,类似人脑。他们创建了全局工作空间(J-space),可读取、审计和塑造Claude的活跃思考,并提供了交互演示。

twitter关注列表2026-07-06#AI#技术突破#AI安全
观察
56

Fable 5 自动化 16.1% 远程工作,RLI 最新结果

CAIS和Scale公布Remote Labor Index最新结果,Fable 5模型自动化16.1%的真实远程工作项目,约为Opus 4.8(8.3%)的2倍,GPT-5.5为6.3%。RLI诞生时最佳模型仅2.5%,进步显著,且任务涉及CAD、架构等复杂工具使用,而非简单文本。报告指出代理设置(工具使用、桌面环境、长时运行、工作者-...

twitter关注列表2026-07-05#AI#技术突破#模型
观察
57

百万 token 上下文检索研究

DAIR.AI 发表了首个针对百万 token 规模的上下文检索系统研究。研究中提出了 BlockSearch,一种 0.6B 参数的 LM 检索器,比较前置模型在架构与训练方面做了改进,并能在训练长度之外向前推算 10 倍长度的检索效果。研究提供了对大规模检索系统的系统性评估。

twitter关注列表2026-07-06#技术突破#研究#大模型
观察
59

Meet Hy3 on ModelScope!

Hy3 发布,总参数 295B,21B 活动 MoE,256K 上下文,提供 FP8 量化变体,许可证为 Apache 2.0。 在人类评测中得分 2.67/4,超过 GLM-5.1 的 2.51/4,在前端开发、CI/CD 与数据存储任务上表现更佳,工具调用方差 4%,问题率从 17.4% 降至 7.9%,MRCR 从 42.9% 提升...

twitter关注列表2026-07-06#模型发布#技术突破
值得跟进
60

LongCat-2.0 正式发布:在国产算力集群上完成全流程训练与推理的万亿参数模型

美团技术团队正式发布LongCat-2.0,万亿参数MoE模型(总参数1.6T,平均激活约48B),在5万卡国产算力集群上完成全流程训练与推理。预训练数据超30T tokens,月均日故障率降低70%以上,训练MFU提升1.5倍。SWE-bench Pro得分59.5,超过GPT-5.5和Claude Opus 4.6。原生支持1M上下文...

twitter关注列表2026-07-01#模型发布#技术突破#大模型
高优先级