一句话判断
值得阅读原文获取训练细节和数据集,以便复现或微调用于自定义场景。
核心信息
京东开源了 8B 参数的 JoyAI-VL-Interaction 模型,专为实时视觉驱动交互设计。在 26 个视频理解基准上平均得分 57.53,超过 Qwen3-VL-8B-Instruct 3.37 分。模型每秒处理直播视频并决定是否发言或保持沉默,交互时序通过时间对齐数据和强化学习学习,无需外部检测器。开源内容包括训练配方、数据和部署系统。
原始内容
相关动态
研究者用GPT-5.6解决6个Erdős问题
研究者Shouqiao Wang使用OpenAI的GPT-5.6 Sol Ultra在Codex环境中,在5天内提出了6个Erdős问题的证明方案,并公布了完整的研究过程。工作流程包括多次迭代:尝试、失败、诊断、新方法、证明草稿、对抗性审计、修复。
多代理系统中消除代理冗余工作的进展
Offloop开发了D1调度模型,降低多代理系统的冗余成本,在GDPval基准测试中达成SOTA,与Claude Code和Codex相比效率提升显著,关键数据未明确具体值量值数据(如2.4万亿年收入、技术细节)未具体说明,属于中等价值资讯。
Google DeepMind推出Gemini 3.5 Flash Cyber,轻量化模型专为安全团队设计
Google DeepMind开发Gemini 3.5 Flash Cyber以提升代码漏洞检测效率。该模型通过测试自家代码库(如Google Chrome和Android代码库),展现出捕捉标准模型忽略的复杂漏洞能力,无营销性言论或质量评价。Google DeepMind推出Gemini 3.5 Flash Cyber, Google ...
Atomic Agent 开源本地智能体发布
Atomic 发布开源本地智能体 Atomic Agent,基于 llama.cpp 运行 Qwen、Gemma、Llama 模型,通过 ARIA 快照操作浏览器、编辑文件、执行 shell 命令,具备持久化跨会话记忆,采用稳定前缀缓存降低成本及 TurboQuant 将 KV 缓存压缩 6.4 倍,在 GAIA Level 1 基准上以...
Introducing the Qwen-Audio-3.0-TTS.
阿里巴巴推出了 Qwen-Audio-3.0-TTS 文本转语音模型,提供实时版和高质量版两个版本,支持细粒度标签控制、自然语言指令、16 种语言、noise 鲁棒输出,最长 3 分钟长语音,并已登顶 Artificial Analysis TTS 排行榜。