一句话判断
值得观看视频,了解Kimi K3自主集成ASR/TTS并构建VR场景的自动化能力。
核心信息
Kimi团队展示Kimi K3模型在收到一个3D模型和一条提示后,于30分钟内自主构建了一个VR伴侣,该伴侣能够听、回应、改变表情并在场景间移动,期间K3独立发现并部署了本地ASR和TTS连接LLM,并构建了VR场景。
原始内容
相关动态
Quantized Reasoning Models Think They Need to Think Longer, but They Do Not
Meta 论文发现,量化推理模型在已给出正确答案后仍会自我怀疑,导致过思考失败率高达 52%。对 50 个犹豫词施加惩罚可将推理长度减少 12%-23%,并保持或提升准确率。
AutoLab: Can Frontier Models Solve Long-Horizon Auto Research and Engineering Tasks?
研究人员提出了 AutoLab 基准测试,包含 36 项涉及系统加速、谜题、模型开发及 CUDA kernel 工作的任务,旨在评估模型在长时程自动研究中的表现。通过对 17 个主流模型的测试发现,成功的关键不在于初始想法的质量,而在于模型的持续测试与反馈迭代能力;其中 Claude Opus 4.6 在该基准测试中表现最佳,原因在于其能...
dots-note-3.0获IMO满分金牌
小红书dots团队的大模型dots-note-3.0在第67届IMO中获得42分满分,超过金牌线13分,成为全球首个在IMO官方评卷中斩获满分的大模型,也是中国首个IMO金牌大模型。此前Gemini Deep Think曾获35分。该模型采用智能体化推理系统和加强归纳法,并计划近期开源。
Tencent Hy3 Agent Arena排名#25
Arena.ai评测显示,腾讯Hy3模型在Agent Arena中排名第25位(开放权重模型第5位),在Frontend Code Arena中排名第16位(开放模型第2位)。Hy3在工具使用(bash错误恢复,+2.6%)方面表现强劲,但在可操纵性(用户推回时调整能力)方面较弱,得分为-7.1%。
Kimi K3在AA-Briefcase基准上排名第二,但成本高昂
Artificial Analysis 评测显示,Kimi K3 在 AA-Briefcase 代理工作基准上获得 Elo 1543,排名第二,仅次于 Claude Fable 5(1574),高于 GPT-5.6 Sol(1501)、Claude Sonnet 5(1388)和 Claude Opus 4.8(1347)。与上一代 K2...