一句话判断
移动端 Linux 沙箱实现(iOS iSH ARM64 改造、Android PRoot)及 Native Offloads 架构将设备集成作为 CLI 而非 LLM 工具,值得阅读原文了解工程细节。
核心信息
OpenMinis 作者 wsvn53 开源了 iOS/Android 双端 AI Agent,iOS 端使用深度定制的 iSH(ARM64 guest),Android 端使用 PRoot 实现用户态 chroot。Agent 提供 8 个 LLM 工具和 20 多个设备集成(通过 Native Offloads 作为 CLI),支持最多 200 轮并发工具循环、Skills 兼容 Claude Code 的 SKILL.md、分层记忆,与 Anthropic 倡导的“代码执行优于工具调用”方向一致。
原始内容
相关动态
Anthropic Opus 5 表现与基准值失衡、指令优先级争议
用户分析发现,Anthropic Opus 5 在基准测试中表现超出 Fable 5 并引发基准值有效性质疑。根据 Kun Chen 的观察,尽管 Opus 5 在多项指标上胜过 Fable 5,但实际应用场景中两者效能差异显著。研究指出公司在 5 系列模型训练策略上发生变化,将 Mythos 作为先导模型后通过蒸馏生成 Sonnet 和...
NVIDIA 研究:AdamW 在大批量训练中存在规模上限
NVIDIA 研究发现,AdamW 在批量大小达到 1 亿 token 时训练稳定性下降,而 SOAP 和 Muon 保持稳定。团队通过每步 QR 正交化和改进预处理策略消除了 SOAP 在大批量下的 loss spikes,并在多十亿参数模型上训练数万亿 token 后,SOAP 和 Muon 一致优于 AdamW。
布雷德用Opus 5制作4K 120fps《暗黑行动》视频
Brad Wardell uses Opus 5 with Clairvoyance and Matt Shumer's prompt to create a Claude of Duty video, capturing at 120fps 4K resolution in a single shot.
From Memory to Skills: Evidence-Grounded Co-Evolution Governance for Long-Horizon LLM Agents
论文指出大多数代理记忆系统只保存事件并在上下文召回,导致重复推理错误。作者提出MSCE方法,将经验组织为声明性事实、诱导程序化策略和基础步骤轨迹,仅将重复模式提升为可调用的过程(如pip安装失败时运行规则),每个策略需具备触发条件、边界、正向收益估计和证据支持。
Understanding Reasoning from Pretraining to Post-Training
论文通过象棋实验(5M-1B参数模型,36种预训练-RL组合)发现:预训练验证损失能高精度预测后RL的pass@1(相关性从0.93到0.99),RL计算量每10倍增益与预训练token数对数正相关(r=+0.84);RL最优计算量份额在50M参数时为20%,680M时为28%,且RL会放大模型在困难问题上的错误模式。