Signal Feed

#AI模型 主题信号

围绕 AI模型 的精选动态、来源摘要和重要性判断。

动态列表

01

Kimi K3 编码代理评测

Artificial Analysis发布Kimi K3在编码代理指数上的评测结果:得分57,排名第5,性能与GPT-5.6 Terra和GPT-5.5持平(57),超过Opus 4.8(55),略低于Grok 4.5(58)和Fable 5(59);成本平均3.18美元/任务,比GPT-5.6 Sol便宜55%。

twitter关注列表2026-07-17#AI模型#评测
观察
02

Gemini API新增管理代理功能

Google发布Gemini API管理代理更新,新增免费层可用性、预算警报功能和计划执行触发器。免费层支持无账单开发,预算控制通过max_total_tokens参数防止成本失控,计划任务通过cron调度实现自动化。

twitter关注列表2026-07-16#技术更新#产品发布#AI模型
值得跟进
04

Mira创立Thinking Machines推出开源模型Inkling

Mira Murati创立Thinking Machines公司推出全权重开源模型Inkling,975B总参数-MoE架构、41B激活参数、1M上下文长度,Apache 2.0授权。Mira明确声明'Inkling落后于前沿',强调企业可通过自有数据fine-tune定制模型,挑战GPT-5.5等闭源模型的垄断模式。

twitter关注列表2026-07-16#AI模型#开源#技术突破
值得跟进
05

Audex:30B总参音频MoE

NVIDIA发布Audex,一个30B总参数/3B活跃参数的音频-文本MoE模型,基于Nemotron-Cascade-2构建。它在BigBenchAudio(90.0)、Audio Entailment AudioCaps(95.6)和CMM(90.3)上取得高分,同时保持文本推理能力。模型覆盖音频理解、ASR、语音翻译、TTS、语音生...

twitter关注列表2026-07-07#模型发布#多模态#AI模型
观察
07

Tencent Hunyuan Hy3 在OpenRouter上发布

Tencent Hunyuan 和 Novita Labs 通过 OpenRouter 平台推出大模型 Hy3,该模型基于 295B MoE(21B 活跃参数)架构,支持 256K 上下文长度,提供三种可配置推理模式,并专注于代码生成、推理与长上下文场景的优化,针对企业级 AI 工作流。

twitter关注列表2026-07-07#模型发布#AI模型#产品发布
值得跟进
09

预分类路由器的战略思考及GPT-5经验的启示

社交媒体用户提出,过度依赖预分类路由模型可能导致工作不足,因路由问题复杂且智能估值容易低估。相关讨论提到OpenAI在开发GPT-5时学到的经验,这些经验对当前路由器的设计有启示。该帖子引用了X平台用户Mikhail Parakhin的观点,其认为:很多团队希望通过使用更简单的模型节省成本/延迟时间/理智,但要想可靠实现需要首先解决这一任...

twitter关注列表2026-07-01#AI模型#行业动态#模型优化
观察
12

LLM攻克理论CS开放问题

Binghui Peng 团队使用 GPT 5.5 Pro 和 Claude Opus 4.8 构建 prover-verifier 循环,解决了 9 个理论计算机科学开放问题,包括 COLT 和 FOCS 会议上的 5 个以及交换代数中的 4 个,并计划扩展到所有科学领域。

twitter关注列表2026-06-30#技术突破#AI模型#研究
观察
13

Introducing Claude Sonnet 5

Anthropic发布Claude Sonnet 5,性能接近Opus 4.8但价格更低(输入$2-3/百万token,输出$10-15/百万token),相比Sonnet 4.6在推理、工具使用、编码等能力上显著提升,安全评估显示不良行为率更低。

Anthropic-news2026-06-30#模型发布#技术突破#AI模型
值得跟进
15

Google 发布 Omni Flash 预览

Google 发布 Gemini Omni Flash Preview 和 Nano Banana 2 Lite,其中 Omni Flash 在视频编辑方面达到 SOTA,定价 $0.10/秒(与 Veo 3.1 Fast 相同);Nano Banana 2 Lite 生成图像速度极快(<4秒),定价 $0.034/千张图像。

twitter关注列表2026-06-30#模型发布#AI模型
观察
18

Grok 4.5 内部测试

SpaceX 发布 Grok 4.5 私人测试版,基于 1.5T 参数的 V9 基础模型,并在补充训练中使用了 Cursor 数据。早期评估显示性能接近甚至超过 Opus,RL 持续改进模型,并计划今年每月发布全新训练的模型。

twitter关注列表2026-06-28#模型发布#AI模型#技术
观察
19

字节跳动将发布Seedance 2.5视频模型

字节跳动宣布将于7月初发布Seedance 2.5视频生成模型,支持30秒视频生成(含音频和4K分辨率),参考图片/音频/视频数量提升至50个,并支持局部编辑。Seedance 2版本年化收入达20亿美元,每15秒视频收费2.5美元,已生成超330万小时视频。

twitter关注列表2026-06-27#模型发布#AI模型#产品更新
观察
21

OpenAI GPT-5.6 系列模型预览发布

OpenAI 发布 GPT-5.6 系列模型预览,包括旗舰 Sol($5/$30)、均衡 Terra($2.5/$15)和轻量 Luna($1/$6),并引入 Ultra 模式通过 subagents 实现多 Agent 协作。Terminal-Bench 2.1 上 Sol Ultra 达 91.9%,Sol 88.8%;GeneBen...

twitter关注列表2026-06-27#AI模型#发布#大模型
观察
24

OpenAI introduces GPT-5.6 model suite with Sol, Terra, Luna

OpenAI发布GPT-5.6模型套件预览,包括旗舰模型Sol、中档Terra和廉价Luna。美国要求先进行小规模可信预览。Sol在agentic任务和Terminal-Bench 2.1上优于GPT-5.5,网络安全能力增强但未达内部Cyber Critical阈值。定价Sol为$5/1M输入token、$30/1M输出token,安全...

twitter关注列表2026-06-26#AI#模型发布#AI模型
观察
26

OpenAI 预览 GPT-5.6 Sol 系列模型

OpenAI 预览 GPT-5.6 系列模型(Sol, Terra, Luna),采用分层部署新模式:先合作伙伴后广泛开放,并提前与美国政府协调。Sol 是目前最强模型,支持超长推理和子代理超模式,但未达到网络关键阈值。目前为有限预览,基准测试待后续公布。

twitter关注列表2026-06-26#模型发布#AI模型
值得跟进