Signal Brief

京东开源 JoyAI-VL-Interaction 实时视频交互模型

京东开源了 8B 参数的 JoyAI-VL-Interaction 模型,专为实时视觉驱动交互设计。在 26 个视频理解基准上平均得分 57.53,超过 Qwen3-VL-8B-Instruct 3.37 分。模型每秒处理直播视频并决定是否发言或保持沉默,交互时序通过时间对齐数据和强化学习学习,无需...

twitter关注列表 ModelScope (@ModelScope2022) 发布 2026-07-23 收录 2026-07-23 观察

一句话判断

值得阅读原文获取训练细节和数据集,以便复现或微调用于自定义场景。

核心信息

京东开源了 8B 参数的 JoyAI-VL-Interaction 模型,专为实时视觉驱动交互设计。在 26 个视频理解基准上平均得分 57.53,超过 Qwen3-VL-8B-Instruct 3.37 分。模型每秒处理直播视频并决定是否发言或保持沉默,交互时序通过时间对齐数据和强化学习学习,无需外部检测器。开源内容包括训练配方、数据和部署系统。

原始内容

Meet JoyAI-VL-Interaction from JD Open Source, an 8B-scale model for real-time, vision-driven interaction. 🚀License: Apache 2.0. 🤖 https://t.co/tNnV20Gddq 📄 https://t.co/STkBjMzeMe 🏆 Across 26 video understanding benchmarks, it averages 57.53, outperforming Qwen3-VL-8B-Instruct by 3.37 points. 👁️ It continuously watches live video and decides every second whether to speak, stay silent, or delegate a harder task while keeping track of the stream. 🧠 Interaction timing is learned from time-aligned data and RL, without an external turn detector. The release includes the training recipe, data, and deployment system. https://video.twimg.com/amplify_video/2080246338134872064/vid/avc1/1280x642/LObNz6e8RHYuOR5x.mp4?tag=29

相关动态

01

研究者用GPT-5.6解决6个Erdős问题

研究者Shouqiao Wang使用OpenAI的GPT-5.6 Sol Ultra在Codex环境中,在5天内提出了6个Erdős问题的证明方案,并公布了完整的研究过程。工作流程包括多次迭代:尝试、失败、诊断、新方法、证明草稿、对抗性审计、修复。

twitter关注列表2026-07-23#研究#技术突破#AI模型
观察
04

Atomic Agent 开源本地智能体发布

Atomic 发布开源本地智能体 Atomic Agent,基于 llama.cpp 运行 Qwen、Gemma、Llama 模型,通过 ARIA 快照操作浏览器、编辑文件、执行 shell 命令,具备持久化跨会话记忆,采用稳定前缀缓存降低成本及 TurboQuant 将 KV 缓存压缩 6.4 倍,在 GAIA Level 1 基准上以...

twitter关注列表2026-07-23#开源#产品发布#技术突破
观察
05

Introducing the Qwen-Audio-3.0-TTS.

阿里巴巴推出了 Qwen-Audio-3.0-TTS 文本转语音模型,提供实时版和高质量版两个版本,支持细粒度标签控制、自然语言指令、16 种语言、noise 鲁棒输出,最长 3 分钟长语音,并已登顶 Artificial Analysis TTS 排行榜。

twitter关注列表2026-07-23#技术#模型发布
观察