一句话判断
新增细粒度标签和自然语言控制功能,16 种语言覆盖,设备噪音鲁棒,一举登顶 TTS 排行榜,值得深入探讨其应用潜力。
核心信息
阿里巴巴推出了 Qwen-Audio-3.0-TTS 文本转语音模型,提供实时版和高质量版两个版本,支持细粒度标签控制、自然语言指令、16 种语言、noise 鲁棒输出,最长 3 分钟长语音,并已登顶 Artificial Analysis TTS 排行榜。
原始内容
相关动态
Harness Handbook论文提升编码代理规划胜率
Harness Handbook论文提出使用静态分析和LLM辅助的BGPD流程,构建从运行时行为到源码位置的映射,在60个修改请求上规划胜率从28.3%提升至38.3%和从26.7%提升至45.6%,规划器token使用下降12.7%和8.6%,文件级和符号级F1在24个对比中全面优于GPT-5.5和Opus 4.8参考计划,定位失败减少...
X的Grok月活用户数117%同比增长
X公司的Grok在过去一年全年用户月活增加了117%,超過一倍增長。此增长速度显示出强劲的市场接受度。数据来自X公司内部统计。
Meet Qwen-Image-3.0 — the third generation of our foundational image generation model.
Qwen团队发布第三代图像生成模型Qwen-Image-3.0,支持4.5k token提示、一次生成复杂布局,文字可读至10px,原生支持12种语言和100+艺术风格,具备真实世界知识和实时网络检索能力,强调实用性。
红点笔记模型获 IMO 完美分数
RedNote 的 dots‑note‑3.0 AI 模型在国际数学奥林匹克赛中得满分 42/42,超越去年 DeepMind 和 OpenAI 的 35/42,且仅有 7 名 666 名人类选手匹配。该模型仍在 beta,为 dots3 系列中最小的变体,公司承诺日后开源。
OpenAI Code模型升级及Cerebras GPT-5.6 Sol速度突破
OpenAI_upgrade Codex功能(增加实时语音支持与并行工作代理),Cerebras_GP5.6 Sol推动性能至750 tok/s。多中流程升级凸显大模型交互速度优化方向。