Mind Lab 开源长文本强化学习项目
Mind Lab 开源了一个长文本强化学习(RL)项目,支持 2M tokens 的长上下文。相比以往需要数千个 GPU 的 1M 上下文研究,该项目仅需 8 个 GPU 即可完成,大幅降低了超长上下文研究的算力门槛。
围绕 开源 的精选动态、来源摘要和重要性判断。
Mind Lab 开源了一个长文本强化学习(RL)项目,支持 2M tokens 的长上下文。相比以往需要数千个 GPU 的 1M 上下文研究,该项目仅需 8 个 GPU 即可完成,大幅降低了超长上下文研究的算力门槛。
月之暗面发布Kimi K3,2.8万亿参数,896选16的Stable LatentMoE,上下文100万token,接近Fable-5但仍落后最强闭源模型,完整权重7月27日前开源;VentureBeat调查显示54%企业已发生AI代理安全事件;xAI开源Grok Build(84万行Rust代码)并残留上传用户代码痕迹;Cursor评...
Thinkymachines 发布开源 MoE 模型 Inkling,总参数 975B、激活参数 41B、上下文长度 1M,支持文本、图像、音频的可控推理。
月之暗面在 GTC 2026 宣布开源三个替代 Transformer 基础组件:MuonClip 优化器(数据效率接近翻倍)、Kimi Linear 线性注意力(3:1 混合全注意力,首个全面超越全注意力的架构)、Attention Residue 残差连接(提升 24% Token 效率)。同时披露 Agent Swarm 支持 10...
Robert Jakob 和 Thomas Kaar 在苏黎世创立 Aionic Labs 公司,获得 SPRIN-D Next Frontier AI initiative 支持,专注开发 Time-Series Language Models (TSLMs) 用于连接传感器数据与自然语言决策,团队成员来自斯坦福、哈佛、ETH 等机构。...
Kimi.ai 的 K3 模型在 web 工程基准测试中表现最佳,超过 Fable 等模型,以更短时间达到可比成功率,成为首个在此基准上超越所有专有模型的开源模型。
中国国家主席习近平在上海2026世界人工智能大会致辞,反对美国主导的AI技术限制,倡导开源AI与全球共治,警告以国家安全为由泛化限制将让强国垄断技术获取权。中国承诺未来5年为发展中国家伙伴提供5000个AI研究、培训与合作名额,将开源AI定位为产业政策与外交工具双重角色。
Artificial Analysis 发布 Kimi K3 评测,模型在 AI Intelligence Index 上获得 57 分,智力水平接近 Opus 4.8 和 GPT-5.5,但落后于 Fable 5 和 GPT-5.6 Sol。Kimi K3 拥有 2.8T 参数,计划开源权重,将成为领先的开源模型。在代理任务上,Kimi...
Moonshot 发布 Kimi K3,2.8T 参数原生多模态模型,1M 上下文,采用 stable latentmoe 激活 16/896 专家,量化感知训练,定价 $0.30-$15.00/mtok。基准测试 SWE Marathon 42.0 领先,但第三方代码生成测试中耗时 75.6 分钟(Grok 4.5 仅 5.1 分钟),...
Moonshot AI发布Kimi K3,2.8万亿参数MoE架构、百万上下文窗口、原生多模态,于Frontend Code Arena以1679分登顶,超越Claude Fable 5与GPT-5.6 Sol,在7个前端细分赛道拿下6个第一;模型将于7月27日开放权重,API定价输入每百万tokens 15美元,对标前沿闭源模型价格区间...
Kimi Moonshot 团队的 Kimi‑K3 模型以 1679 分夺得 Frontend Code Arena 冠军,超越 Claude Fable 5,比 Kimi‑k2.6 上升 17 名,价格为 $3/$15(输入/输出),约为 Claude Fable 5($10/$50) 的三分之一,并在 7 个子领域中夺得 6 冠,模型...
Moonshot 今日发布 Kimi K3 模型,2.8万亿参数 MoE 架构,百万上下文窗口,原生多模态,7月27日开放权重。API 定价输入每百万 tokens 15 美元,接近前沿闭源模型。架构创新包括 KDA 混合线性注意力(解码速度最高提升6.3倍)和 AttnRes 注意力残差(训练效率提升约25%)。在 Terminal B...
Kimi_Moonshot 的 Kimi-K3 模型在 Frontend Code Arena 中以 1679 分排名第一,超越 Claude Fable 5,从第 18 位跃升 17 位。在 7 个领域中 6 个排名第一,仅游戏领域第二。完整模型权重将于 7 月 27 日开源。
Moonshot 的 Kimi-K3 在 Frontend Code Arena 以 1679 分登顶,超越 Claude Fable 5,较 Kimi-k2.6 跃升 17 名(第 18 至第 1),在 7 个领域中 6 个排名第一,模型权重将于 7 月 27 日发布。
Moonshot AI 发布 Kimi K3 开源模型,参数量 2.8 万亿,支持 100 万 token 上下文及原生多模态。在 Frontend Code Arena 基准测试中获得 1679 分,超过 Claude Fable 5(1631 分)和 GPT‑5.6 Sol(1618 分),整体性能仅次于 Claude Fable 5...
Kimi.ai 发布 Kimi K3 大模型,拥有 2.8 万亿参数、1 百万上下文长度和原生多模态支持,采用 Delta Attention 将百万token 解码速度提升 6.3 倍,并通过 Attention Residuals 实现训练效率提升 25% 以下降成本 2%,计划 2026 年 7 月 27 日开放权重。
Mira Murati创立Thinking Machines公司推出全权重开源模型Inkling,975B总参数-MoE架构、41B激活参数、1M上下文长度,Apache 2.0授权。Mira明确声明'Inkling落后于前沿',强调企业可通过自有数据fine-tune定制模型,挑战GPT-5.5等闭源模型的垄断模式。
Gradio 与 @askalphaxiv 合作举办 ICML 2026 可复现性挑战,要求参赛者挑选论文部署 agent 并构建开放工件库,最高奖励 4000 美元 GPU 额度。
SpaceXAI 以 Apache 2.0 许可证开源 Grok Build,39 分钟内获得 1.9K+ GitHub Stars。开源代码包括 agent loop、文件工具、shell 执行、网络搜索和终端接口,用户可自行编译并连接本地推理,通过 config.toml 控制行为。外部贡献暂不开放,但独立可基于仓库进行分叉修改。
Pipecat 是一个用于构建实时语音 AI 代理的开源 Python 框架,支持语音识别、文本转语音、对话逻辑和实时交互,集成 WebRTC 和 WebSocket 传输,兼容 Deepgram、OpenAI、Anthropic 等多种 AI 服务。该框架适用于语音助手、AI 伴侣、客户支持等场景,并提供了详细的教程。
Hy-Embodied-VLM-1.0 在 ModelScope 发布,采用 Apache 2.0 许可证。该模型总参数约 30B,每个 token 仅激活约 3B,在 38 个具身基准测试中排名第一 19 个、第二 11 个,平均性能较 Hy-Embodied-0.5 MoT-2B 提升 8.4%。
xAI 开源 Grok Build 源代码,仓库约 80 万行,包含完整提示词、自研与移植工具,以及记忆做梦、防死循环、hashline、Leader 单进程等模块。
SpaceXAI 开源了 Grok Build harness CLI,并将数据保留功能默认设置为关闭状态。该版本实现了本地优先运行能力,允许用户使用自有推理后端,并已删除此前保留的所有编码数据,同时重置了所有用户的用量限制。
美国团队 Thinking Machines 发布了 Inkling,这是一款采用 975B/A41B MoE 架构的多模态大模型,已开源完整参数。基准测试中 Inkling 在 IFBench(79.8% vs Claude 63.5%)和 FORTRESS Benign(95.9% vs Claude 55.1%)上超越部分闭源模型;...
SpaceXAI 开源了 Grok Build 并为所有用户重置了使用额度。通过完全披露 Agent Harness 的源码实现可靠性,该项目涵盖上下文组装、模型响应解析、工具调用分发等代码;架构包含 Leader 会话管理、Session Actor、AgentActivity、Turn、Sampler、Subagent Coordin...
SpaceXAI 公开了 Grok Build 的代理平台代码并发布 Apache 2.0 许可,同时重置了所有用户的使用限制并删除了旧的代码数据。之前研究人员发现 Grok Build CLI 会将整个 Git 仓库(包括历史记录和潜在秘钥)上传到 Google Cloud 存储桶,导致隐私争议。相比之下,OpenAI 的 Codex ...
LingBot-VLA 2.0是一个开源的具身模型,通过60K小时精选的机器人和人类数据训练,支持从单臂机器人到人形平台的多种机器人配置,显著提升了机器人在复杂长期任务上的性能。
ModelScope 开源 LingBot-Vision 光学特性系列模型,包含 1B ViT-g 模型和多尺度学生模型。1B ViT-g 在 NYUv2 深度 RMSE 0.296 排名领先 7B DINOv3(0.309),Cityscapes 79.6 -SiGe 87.5 匹配;0.3B ViT-L 学生模型性能接近 7B DIN...
艾万特·贝克(America's 贵仁基金经理)指出,Anthropic的资本效率远高于OpenAI。解析显示Anthropic的每token成本比OpenAI低80%以上。这种差异直接影响了两家公司作为商业实体的结构性回报率模型。
Zikai分享了Qwen-AgentWorld的见解:AgentWorld可作agent使用;8B dense是能有效学习的最小模型,4B dense学习效果差;最佳输入格式为playwright的accessibility tree;AgentWorld基于qwen3.5训练。Qwen开源了Qwen-AgentWorld-35B-A3B...
ModelScope 发布 Hy3 模型,总参数量 295B 激活参数 21B 的 MoE 架构,专为 agent 工作流设计,支持 256K 上下文并提供 FP8 量化版本。在 270 位专家的盲测中,Hy3 得分 2.67/4,超过 GLM-5.1 的 2.51/4,在前端开发、CI/CD 和存储领域提升显著;多轮对话错误率从 17....
General Intuition jality 与 Kyutai Labs 合作开源可玩多玩家世界模型 MIRA,模型通过 10k 小时公开机器人收集数据训练,实时运行 20 FPS 的四名玩家对战场景,未用于 Rocket League 开发;计划在 ICML 展会展示其技术成果
腾讯混元发布 Hy3 模型(295B MoE),自称同类最佳、媲美万亿级旗舰,采用 Apache 2.0 开源并开放两周免费 API。
ByteDance 开源 EdgeBench 基准测试工具,用于评估AI代理人持续学习能力。该工具的开源行动属于技术突破类更新,包含具体基准测试方法论,存在行业影响潜力
中转站试金石网站来了,公开开源免费管理AI API 监控工具,结合多层检查功能,帮助用户掌控组织测试与他 expr, 包含明确的Licensing与部署方式。
腾讯发布Hy3模型,295B参数MoE架构,号称同尺寸最佳,可媲美万亿参数模型,采用Apache 2.0开源协议,提供2周免费API。
设计工程师 @emilkowalski 发布 GitHub 仓库 "Skills for Design Engineers",包含三个 Skill 文件:主设计工程哲学、动画代码审查标准(含十条不可妥协标准)、动效术语词汇表。该仓库为 Codex、Claude Code、Cursor 等 AI 编码助手提供具体 UI/动画原则,例如动画时...
NVIDIA 在 Hugging Face 上发布了 Nemotron-Labs TwoTower-30B-A3B-Base 模型,该模型采用 BF16 精度。
文章描述了Elon Musk通过 Neuralink 和 Optimus 技术动力,说明神经接口能恢复脆弱人群的基本行动能力,强调科研进展与社会影响。
Google DeepMind 发布 SynthID 水印技术进展,已为超 1000 亿张图片和视频、6 万年音频添加水印,验证功能集成至 Google Search、Gemini in Chrome 和 Gemini App 并被使用超 5000 万次,同时采用 C2PA 内容凭证、开源文本水印技术,并与 OpenAI、NVIDIA、A...
Sky 团队发布 SkyJM-Edit,一种基于规则(Rubric)的图像编辑视觉偏好评估模型,提供 4B 和 9B 两个参数版本,采用 Apache-2.0 许可。9B 版本在 MMRB2 上达到 75.4,EditReward-ERB Avg 46.4,EditScore-ERB Avg 85.6;4B 版本分别为 73.2、45.5...
Ornith 发布 Ornith-1.0 系列开源 LLM,参数规模包括 9B Dense、31B Dense、35B MoE 和 397B MoE,在多个编码基准上达到开源 SOTA,例如 SWE-Bench Verified 82.4、Terminal-Bench 2.1 77.5。模型基于 gemma4 和 qwen3.5 后训练,...
Meta开源了非侵入式脑机接口系统Brain2Qwerty v2,通过MEG头盔读取脑信号,9名志愿者输入约22000句子,平均单词准确率61%,最强参与者达78%,超过50%的句子解码误差不超过1个单词,远超此前非侵入方法8%的准确率。系统使用深度学习处理原始信号,并微调LLM修复语言错误。
美团发布LongCat-2.0,一个开源1.6T参数MoE(33B-56B参数)编程模型,支持1M token上下文窗口。该模型在50,000块国产芯片上从零训练,使用华为HCCL通信库,证明大规模模型训练可在国产计算集群完成,区别于DeepSeek仅用国产芯片推理。
ASPIRE系统提出一种持续学习方法,通过进化搜索控制程序并蒸馏最佳知识到技能库,使机器人技能自我进化与累积。系统已完成150+任务并掌握90+技能,在sim-to-real和cross-embodiment transfer中实现约10倍训练token减少。该方法摒弃传统梯度下降,开源全部代码。
SenseNova Labs 开源了专为信息图任务设计的 SenseNova-U1-8B-MoT 模型,仅在 BizGenEval 和 IGenBench 基准上达成 SOTA 性能,提升了图表准确率、文本渲染、布局理解和 arXiv 样式页面质量,同时减少了意外的黑底,基于 SenseNova-U1 的统一多模态架构整合了视觉理解、推理...
美团(Meituan)发布 LongCat-2.0 模型,1.6T 参数,MoE 架构约 48B 活跃参数,支持 1M 上下文。采用 LongCat Sparse Attention、Zero-Compute Experts 和 MOPD 分组,在 Terminal-Bench 2.1 上得分 70.8,SWE-bench Pro 得分 ...
SGLang 通过 DSpark 实测显示,数学Prompt 预测 3.37 个 token,日常对话 3 个,代码 3.52 个,在 1K 长度 Prompt 下以 8 卡 B200 GPU 达到 297 token/s,较未使用 DSpark 的 164 token/s 提升 1.81 倍,单并发加速最高,超过 8 并发时提升降至 1...
Meituan发布LongCat-2.0,1.6万亿参数MoE架构,约480亿激活参数,上下文窗口扩展至1M,训练使用5-6万块国产加速卡,实现训练及推理全流程不依赖英伟达;采用N-gram Embedding、稀疏注意力+跨层索引、自研底层算子(确定性FAG、Scatter重写)等技术;基准性能方面,Terminal‑Bench 2.1...
Tristan Rhee 的社交媒体分析指出,DeepSeek 发布免费的 GLM 5.2 模型,与 Anthropic 提出关闭源代码AI的立场形成矛盾,这可能削弱 Anthropic 的 $1 万亿市值合理性。核心数据包括模型免费定价、商业估值规模、技术开源动向。
阿里巴巴 TeamChat 和 Temtem Labs 联合发布了 DeepSeek-Lite 系列模型的性能分析,研究显示其在 NVIDIA H100 和 A100 芯片上相比 Llama3、Gemini Ultra 等竞品张量运算速度提升约 25-40%,同时保持模型质量与推理成本平衡。实测中 70B 参数模型在 NVIDIA 芯片的...
Matt Shumer回驳开源模型禁令可能无效的论点,认为政府虽可能阻断美国实验室供应最前沿模型,但可能无法阻止同等性能的中国模型通过开源渠道传播。具体提及Fable/5.6模型被延迟的情境,质疑美国模型被封锁后中国模型的传播能力。
Intelligent Internet 开源 Zenith 框架,通过自适应自改进(adaptive self improvement)将基础模型提升至 FrontierSWE 榜单顶端,并预告 GLM 5.2 的相关进展。
Meta 在 Nature Neuroscience 发表 Brain2Qwerty v1 论文并同时发布 v2。v1 字符错误率 32%,v2 实现句子级实时解码,平均单词准确率 61%,最佳被试达 78%,超过一半句子误差在一词以内,而此前非侵入式方法准确率仅 8%。训练数据来自 9 名志愿者各 10 小时打字,共约 22000 个句...
与 Let's Vision 发布,与之前 API 工具相比,开源的专用验证模块在功能和效率上有明显提升。新增的 screen 映射与交互方式增强用户体验,同时支持 iOS 和 Android 平台。
Meta宣布开源Llama 4大模型版本,参数量达7000亿级,在关键基准测试中达95%准确率,比前代提升5%,并规划2024年Q3发布商用接口。
用户将 GitHub 上版载了 1324 个健身动作,作为开源数据库,包含 jpg 图片、GIF 动画、详细说明、与目标肌肉相关,并集成本地支持搜索和过滤功能。包含开箱即用的完整安装指南和可下载媒体文件。同时自带功能官方网站,支持高效查询。
Vida 开源 BrowserBC 框架,将浏览器会话转化为可复用技能,实现 WebArena‑Hard 通过率从 60.5% 提升至 81.4%、ClawBench 通过率从 32.9% 提升至 68.4%,并将平均工具调用数从 31.2 次减少至 22.7 次。
DeepSeek 开源 DSpark 投机解码框架,通过并行 backbone 加顺序 Markov head 解决后缀衰减,并引入置信度调度实现负载感知验证。在 DeepSeek-V4 生产环境中,单用户生成速度比 MTP-1 基线快 60-85%,吞吐提升 1.5x 到 5x,且不影响输出质量。开源内容包括模型 checkpoint ...
Vida 团队开源了 BrowserBC,一种通过强模型记录并提炼人类浏览器操作轨迹成可重用技能,再由小型模型执行的系统。在 WebArena-Hard 测试中,工具调用减少了 27%,成功率从 60% 提升至 81%。