一句话判断
新增多 agent 语音控制功能,值得体验全双工语音交互效率。
核心信息
OpenAI 在桌面应用上推出 ChatGPT Voice 功能,基于 GPT-Live 1 全双工语音模型,支持语音控制多个 agent,面向 Plus、Pro、Business、Edu 和 Enterprise 计划的用户,覆盖 macOS 和 Windows 平台,iOS 可通过配对远程访问。
原始内容
相关动态
BestBlogs 早报 · 07-24
本次早报包含10条AI新闻:Anthropic升级Claude语音模式支持Opus与Sonnet;梁文锋透露DeepSeek将Agent持续学习作为下一目标,承认算力与数据约束;阿里开源Agent评测框架skill-up,内部将1200行代码收敛为声明式;Andrew Ng推出开源智能体OpenWorker;此外还有关于Agent PR频...
Fugu-Ultra v1.1发布
Fugu发布Fugu-Ultra v1.1,性能最高提升7.9分,尤其在ProgramBench和Terminal Bench 2.1上,价格不变。
ChatGPT 桌面版上线语音控制功能
OpenAI 发布 ChatGPT 桌面版语音功能,由 GPT-Live 驱动,支持语音控制电脑并协调 ChatGPT Work 和 Codex 多智能体协作,今日起在 macOS 和 Windows 面向 Plus、Pro、Business、Edu、Enterprise 订阅用户全球推出。
AI代码库知识图谱方法分享
Mark Ajzenstadt 分享一个团队通过先构建知识图谱再使用AI的方法,在3.5个月内完成FedEx供应商平台重建,AI生成90%代码,合并122个PR,计算成本200美元/月。
Sonilo 发布音频模型 1.0
Sonilo 发布了视频原生音频模型 Sound Effects 1.0,可自动从视频同步音频,支持三分钟输入并可根据文本生成独立音频素材。该模型与现有的 Video2Music 和 Text2Music 工具集成,Fal 独家提供 Day Zero API,并在基准测试中声称超越领先模型。