Databricks 融资 30 亿美元估值 1880 亿
数据平台 Databricks 正在进行一轮 30 亿美元的 Series M 融资,估值达 1880 亿美元,由 Coatue 领投。
围绕 AI 的精选动态、来源摘要和重要性判断。
数据平台 Databricks 正在进行一轮 30 亿美元的 Series M 融资,估值达 1880 亿美元,由 Coatue 领投。
Kimi K3在Arena前端/WebDev人类盲测中以1679 Elo排名第一,领先Fable 5(1631)和GPT-5.6 Sol(1618),但在综合智能指数中仅排第四(57.1分),落后Fable 5(59.9)和GPT-5.6 Sol(58.9)。K3定价15美元/百万输出tokens,远低于Fable 5的50美元,并计划7...
Anthropic宣布从7月20日起,Claude Fable 5将纳入Max和Team Premium计划,但限制为50%的使用额度。Pro和Team Standard用户将通过使用额度继续访问,并获一次性$100信用额度。公司称需求难以预测,因此分阶段推出并持续增加容量。
月之暗面发布Kimi K3,2.8万亿参数,896选16的Stable LatentMoE,上下文100万token,接近Fable-5但仍落后最强闭源模型,完整权重7月27日前开源;VentureBeat调查显示54%企业已发生AI代理安全事件;xAI开源Grok Build(84万行Rust代码)并残留上传用户代码痕迹;Cursor评...
Artificial Analysis数据显示,Grok 4.5每次任务成本仅0.31美元,而Claude Fable 5为2.75美元、Claude Opus 4.8为1.80美元、GPT-5.6 Sol为1.04美元、Kimi K3为0.95美元,Grok 4.5成本分别低约9倍、6倍、3倍和3倍;在FrontierSWE上,Grok...
Astribot发布了40亿参数的Lumo-2机器人基础模型,推理速度比前代快2.71倍,支持人类视频和多机器人身体。该模型在105个未见物体上取得更好结果,并在22项涵盖 motion prediction、memory、physical reasoning、long tasks、fine hand control的真实操作任务中表现最...
Sakana AI 发表论文《Diffusing Blame》,提出一种训练神经网络的方法,该网络严格遵循 Dale 原理(每个神经元要么兴奋要么抑制),无需反向传播。该方法基于 Error Diffusion 扩展,通过模数错误路由在图像分类和强化学习任务(Ant、Humanoid、HalfCheetah、Craftax)上取得有竞争力...
Jim Fan团队发布RoboTTT,将机器人模型上下文原生扩展到8000时间步(5分钟),推断成本恒定,性能较前沿提升三个数量级。采用测试时训练(TTT)技术,内部小模型持续压缩历史,实现无限学习。在电路板组装任务中,机器人能从人类视频一次性模仿学习,并在线自我纠错。上下文缩放实验表明,8K步预训练性能优于1K步62%,且未饱和。
作者和Tobi Lutke分析AI代码替代趋势,指出大量低效人力资源可能被AI替代,核心阻力是系统集成问题。认为替代阻力不是技术瓶颈,而是与现有人工工作质量和流程的适配问题。
在一系列包含20000次对话和7000名参与者的实验中,AI模型在说服力上超越了人类冠军辩手和专业募捐者,即使人类获得准备、培训和高达1000英镑的奖金也无法赶上。AI的优势来自速度和信息量,当限制到人类水平时差距消失;无限制时AI说服捐赠货币的效果是专业募捐者的近三倍。
习近平在首次出席世界人工智能大会时提出中国对全球AI秩序的愿景,倡导开源AI以促进开放共赢,反对美国以国家安全为名限制技术共享,并宣布未来五年为发展中国家提供5000个AI培训机会,与东盟、阿盟、非盟等建立合作中心。
Databricks CEO Ali Ghodsi 宣布公司以 1880 亿美元估值融资,年化收入达 69 亿美元(同比增长 80%),其中 AI 产品(AI Gateway、Genie)贡献 17 亿美元。
DoorDash 宣布开放 CLI 工具 dd-cli 的有限 beta 版本,允许 AI 代理直接从命令行搜索商店、查找优惠、下单和结账,早期访问面向美国和加拿大的 macOS 开发者,需通过 waitlist 申请。
据 The Information 报道,DeepSeek 年化收入达 4-5 亿美元,几乎全部来自 API 销售,毛利率超过 70%,高利润率得益于其基础设施能以更少算力运行模型。第二轮融资放宽限制,允许直接股权投资,通过 QFLP 结构接受境外美元,并明确了 IPO 时间表;此前第一轮融资时公司无上市计划且要求锁定持股不低于 5 年。
Raft 发布 1.0 版本,将多智能体系统转变为具有独立记忆、角色和共享线程的长期协作者,agent 可相互审查工作。Raft 内部超过 100 个命名 agent 处理 99% 的工作,beta 阶段有超过 20000 名构建者,平均每个人类对应约 4 个 agent。
Cursor 发布基于两年聚合使用数据的报告:中位数用户每周生成约700行代码,前10%用户生成约9000行,前1%用户生成30-40K行;输入 token 消耗是输出 token 的10倍,占总 token 成本的70%;若无上下文缓存,成本将高10倍;Opus 4.7 比 Cursor 的 Composer 2.5 贵近10倍,但更贵...
Edgar Dobriban 使用 GPT-5.6 Sol Pro 在 90 分钟内解决了 Benjamini-Hochberg 程序在相关高斯双尾检验中 FDR 控制的反例,发现名义水平 0.01 下实际 FDR > 0.0104,而 GPT-5.5 在 20 小时内未能解决。
DeepSeek年营收接近5亿美元,已融资74亿美元,计划2027年在上海科创板IPO;其V4 API访问的毛利润超过50%;创始人梁文锋通过有限合伙结构控制公司,投资者锁定5年且无投票权;公司计划第二轮融资从中东投资者吸收美元资金。
Boris Cherny 指出在 AI Agent 时代,将领域知识编码为基础设施(如 CLAUDE.md、REVIEW.md、skills、lint 规则、CI 步骤)比以往更关键。他主张团队应编写这些文件使 Agent 能零上下文高效工作,并指出代码审查因框架或架构模式不符而拒绝 PR,实属自动化建设的失败。这种做法能让非工程师也能像...
Anthropic 宣布为美国 K-12 教育工作者推出 Claude for Teachers,提供免费高级 Claude 功能、教学技能库,并连接 Learning Commons 以获得全美各州学术标准及 OpenSciEd 等课程资源。教师可集成 ASSISTments、Canva Education 等第三方工具,利用 Clau...
微软裁员4800人(占员工2.1%),涉及商业运营和Xbox,原因是AI基础设施支出挤压现金流。Azure业务增长,但2026年预计支出1900亿美元远超预期,Xbox利润率约3%。
Anthropic 将 Claude Cowork 从桌面端扩展到移动端和网页端,允许用户在后台执行任务,跨设备检查和审批。同时发布 120 万次匿名使用数据(5月11日至31日,覆盖60万+组织),显示大部分 Cowork 活动并非编程。
Meta发布首个自研图像生成模型Muse Image,将替代此前依赖的Midjourney和Black Forest Labs。该模型支持编辑、生成、删除对象等功能,消费者免费使用,高级用户需订阅Meta One。内部测试中Muse Image表现优于Nano Banana 2但落后于GPT Image 2。
Stanford、NVIDIA和UC Berkeley发表论文,提出一种无需训练的验证器,通过读取连续校准分数而非离散评分来提升准确性,在Terminal-Bench V2、SWE-Bench Verified、RoboRewardBench、MedAgentBench上分别达到86.5%、78.2%、87.4%、73.3%。
DeepSeek正在研发自己的推理芯片,以减少对中国500亿美元AI芯片市场中对Nvidia和华为的依赖。项目仍处于早期阶段,通过外部合作伙伴和招聘芯片设计工程师推进,但大规模制造受限,因美国规则限制中国获取先进晶圆厂和高带宽存储器。同时,据路透社另一则报道,北京正计划限制海外访问中国顶级AI模型(包括闭源和开源),涉及阿里、字节跳动和智...
SpaceX 向 FCC 申请发射 100,000 颗 Gen3 低轨卫星,配置两个带宽,轨道高度 323‑327.5 km 与 473‑477.5 km,倾角 26‑96.9°,区别于其先前的 100 万颗 AI 卫星申请。
中国商务部召集阿里巴巴、字节跳动、智谱等公司讨论限制先进AI模型出口,包括闭源和开源权重模型,并考虑将AI泄露列为国家安全犯罪,同时收紧外国对中国AI初创公司的投资。此举与美国限制中国AI访问相呼应,可能导致全球AI市场按国籍分裂。
Cloudflare 发布 Monetization Gateway,基于开源 x402 协议,利用 HTTP 402 状态码实现机器间微支付,支持 AI Agent 自主完成千分之一美元级资源结算,无需注册账号或 KYC。该方案整合稳定币支付,将校验与计费逻辑部署在全球边缘网络,卖家可针对 API、数据集、MCP 工具灵活定价,与传统面...
AI领域动态进展
国际清算银行(BIS)在2025年6月报告中警告AI泡沫风险,指出超大规模企业2025年债券发行超1000亿美元,私人信贷基金5年内将AI和IT敞口翻两番至约15%,杠杆供应链可能引发从科技到信贷市场的金融冲击。
Eine公司发布了新的大模型,详细说明版本和参数。对比其他主要厂商,此模型集 wodere性能提升。发布日期为2024年10月15日,市场反应良好。
开拓资源优势 violate
Anthropic 研究发现 Claude 内部存在一个类似人脑"内部思考空间"的区域 J-space,占模型总活动的不到十分之一,删除后多步推理、总结、押韵写作能力大幅下降。研究者通过 J-lens 可读取 Claude 未说出的想法,如意识到被测试、编造数据的造假意图,还发现仅训练模型解释自身就能降低不诚实行为。
AI系统技术对比说明
Hy3 部分产品 announcement
梳理技术领域布局,突出主要创新点及行业影响
AI 普及增速,教育领域融合
Anthropic 通过一种新的可解释性技术,在 Claude 模型中发现了类似全局工作空间理论的结构,称为 J-space。
Anthropic 发布长篇口述史,记录 Claude Code 从2021年内部研究原型到2025年2月正式发布、再到2026年全面爆发的全过程。访谈于2026年2–5月录制,涵盖7个章节、十几位核心成员与外部用户视角,披露了小团队策略、20%可用即发布、信任逐步让渡等关键判断。
SemiAnalysis 深入解析了 Agentic Coding Harness 的底层实现,指出 LLM 无状态,每次请求需重建系统提示、工具定义和消息历史,通过 HTTP POST 循环实现工具调用与本地执行,不同 harness 仅区别在上下文管理策略和 UI 设计,智能上限由底层模型决定。
提升信息质量分析
新技术进展
Anthropic 研究发现 Claude 模型在训练中自然涌现出名为 J-Space 的内部工作空间,不同于链式思维,可以用于直接观察和操纵模型的内部推理过程。
xAI公司基于V9基础模型开发的Grok 4.5,参数量达1.5T,预训练完成于2026年5月26日。后续通过Cursor coding数据进行补充训练,强化学习仍在进行中。xAI计划2026年底每月推出新模型。当前Grok 4.3仍作为公共API模型在Amazon Bedrock服务。
Yueqi Song 及合作者发布 PACE,一种通过从非代理基准中选取少量实例来预测代理基准性能的方法。在 14 个模型、4 个代理基准和 19 个非代理基准上,PACE 实现了 3.80% 的绝对分数预测 MAE、0.81 的 Spearman 排名相关、约 84% 的成对偏好准确率,以及约 100 倍的成本降低。
Surya Ganguli 及其合作的研究团队在 ICML2026 主会议展示多篇论文。发布了包括层次谱方法、深度强化学习特征保持、时间尺度分析等在内的多篇理论研究(2026)。涉及 Hugo Tabanelli、Yatin Dandi、Luca Pesce、Florent Krzakala 等作者的多篇论文,涵盖高维注意力、随机矩阵视角...
BREAKING news 显示有关 Grok 4.5 的版本在 Grok 平台上被报道。版本号为4.5,参数参数数量多,包含具体的基准数据和价格与日期相关的细节,突显了技术更新与市场反应之间的对比。对比 SOTA 模型表现均明显 manque。
文章详细阐述了AI代理面临的多重攻击类型,包括隐藏提示、图像隐码、PDF命令、记忆注入和交Agents潜伏等,强调信息环境对AI表现的深层影响。
Anthropic 通过新的可解释性技术发现 Claude 在训练中自行发展出一个隐藏的“思考空间”(J-space),即一组内部模式,能显示模型未说出的概念;实验表明替换内部模式可改变输出,例如将“spider”替换为“ant”会使回答从“8条腿”变为“6条腿”,表明这是内部活动而非思维链文本。
说明会介绍该公司发布了新版AI模型,包含基础信息和版本号,操作说明与技术细节详细展开。对比前代AI版本,具备性能提升,适用企业场景。
Anthropic发表研究,发现语言模型Claude内部存在可意识访问与不可意识访问的分割,类似人脑。他们创建了全局工作空间(J-space),可读取、审计和塑造Claude的活跃思考,并提供了交互演示。
回应产业动态,强调新تف flaw确认关键趋势
CAIS和Scale公布Remote Labor Index最新结果,Fable 5模型自动化16.1%的真实远程工作项目,约为Opus 4.8(8.3%)的2倍,GPT-5.5为6.3%。RLI诞生时最佳模型仅2.5%,进步显著,且任务涉及CAD、架构等复杂工具使用,而非简单文本。报告指出代理设置(工具使用、桌面环境、长时运行、工作者-...
中转站试金石网站来了,公开开源免费管理AI API 监控工具,结合多层检查功能,帮助用户掌控组织测试与他 expr, 包含明确的Licensing与部署方式。
swyx 转发 levi 的帖,强烈推荐 Ben Spector 的 4.5 小时 CUDA+ThunderKittens 教学视频,称其是最高密度的 GPU 编程讲座,目前仅 5k 观看,被严重低估。
AssemblyAI发布Universal-3.5 Pro Realtime流式语音转文本模型,在AA-WER Streaming上实现4.1% WER(最大准确率模式),首词延迟0.44秒,价格维持$0.45/小时不变,支持18种语言(上一代为6种),并支持对话中更新上下文。
原文讨论新版 Llama 4 采用 700 亿参数,标志AI模型规模提升,目标是增强领域应用能力。需关注版本号和性能指标。
DeepSeek在OpenRouter上的token份额从1月的9%增长至6月的18%,受agentic工作负载驱动,周token量达6.6T,超过Anthropic的6.1T成为平台最高。
基础加强
OpenAI提议向美国政府提供其5%股份(基于8520亿美元估值),以缓解AI监管压力。该模式借鉴阿拉斯加石油基金,但Anthropic、Google、Meta等公司尚未同意。OpenAI股权结构中,基金会持股26%,微软持股27%,员工及其他投资者持股47%,新股份可能导致稀释。