每日 AI 资讯速递
今日 AI 领域多点开花:人形机器人运动会以 2056 台机器人刷新纪录,展现具身智能的爆发力;Anthropic 密集发布 Claude 生态新工具与安全基金,强化开发者与安全双主线;开源社区则迎来 DeepSeek 视觉模型、LFM2.5 草稿模型及多项推理加速方案,效率竞赛持续升温。
🤖 具身智能与机器人
第二届世界人形机器人运动会开幕:2056 台机器人齐聚"冰丝带",666 支队伍竞技 51 赛项
第二届世界人形机器人运动会今晚在国家速滑馆"冰丝带"开幕,666 支队伍、2056 台机器人参赛,队伍数量较首届增长 138%,机器人数量翻了两番。天工 Ultra 在百米预赛跑出 9.39 秒,打破博尔特 9.58 秒的人类世界纪录;荣耀"闪电"以 41.95 秒完成 400 米,同样破人类纪录。本届赛项增至 51 项,多项竞技赛取消人工遥控,全程全自主运行。
机器人赛事具身智能
🚀 模型与产品发布
DeepSeek-V4-Flash-Vision-Exp 发布
DeepSeek 上线实验性多模态视觉理解模型 DeepSeek-V4-Flash-Vision-Exp,可通过设置 model='deepseek-v4-flash-vision-exp' 在 API 平台访问。该模型延续 Flash 系列的高效路线,为开发者提供新的多模态推理选项。
多模态DeepSeek
阿里发布 Qwen-UI-Agent,主打让模型真正"会用"每一块屏幕
阿里巴巴正式推出 Qwen-UI-Agent,一个以真实世界为中心的 GUI 智能体基座模型,覆盖移动端、电脑端、网页端及深度搜索(DeepSearch)环境。该模型旨在提升 AI 对图形界面的理解与操作能力,为通用智能体落地提供关键基础设施。
智能体GUI阿里巴巴
Mistral 推出 Agentic Search:多步检索提升 AI 系统复杂文档查询准确率
Mistral 发布 Agentic Search,通过 search、open、navigate、read、grep 五工具的多步检索循环,让模型在长文档与多来源中查找、定位并验证信息。这一方案直接针对复杂文档查询场景,减少幻觉并提升答案可追溯性。
检索增强Mistral
🔧 基础设施与开发工具
蚂蚁百灵为SGLang推出权重缓存守护进程
蚂蚁百灵为 SGLang 推出 Weight Cache Daemon,在 Ling-2.6-1T FP8 上,将权重加载时间缩短至约 0.63 秒,比磁盘加载快约 780 倍,并将引擎总启动时间从 8.8 分钟缩短至约 0.53 分钟。该方案显著降低大规模模型的服务启动开销,提升资源利用效率。
推理优化SGLang
AlloyDB ScaNN 如何将向量搜索扩展到 100 亿向量
AlloyDB 的 ScaNN 索引现已支持超过 100 亿向量的规模,通过全新的四层树架构(预览版)实现,将查询复杂度从 O(N^1/2) 降至 O(N^1/4)。内部测试中,该架构在 100 亿向量规模下可实现 p95 延迟不超过 51 毫秒、召回率达 95%。
向量数据库Google
Ling-3.0-flash 在 4 块 Blackwell GPU 上如何将批处理 1 解码延迟降低 54%
蚂蚁 Ling Infra 团队与 RadixArk SGLang 团队将 Ling-3.0-flash 混合线性注意力 MoE 模型的单请求解码速度从 288 tok/s 提升至 606 tok/s,平均 TPOT 从 3.33 ms 降至 1.53 ms。该优化展示了混合线性注意力架构在推理延迟上的巨大潜力。
推理加速Ling
FastMetal 让 Mac 本地 30 秒生成视频
FastMetal 将 FastWan-QAD 系列带到 Apple Silicon,一段 5 秒 480P 视频,完全在 Mac 上生成,耗时 30 秒,仅占用 3.9 GiB 内存。DiT、DMD 采样器和解码器均通过 MLX 在 Metal 上运行,默认 INT8,提供 1.3B、5B、14B 三档模型,实现无 CUDA 的本地视频生成。
端侧推理视频生成
📊 行业动态
消息称 OpenAI 首席财务官告知员工:公司最迟将于 2027 年上市
OpenAI 首席财务官萨拉·弗里亚尔在全员大会上告知员工,公司最迟将于 2027 年完成上市,若业务持续向好也可能更早。OpenAI 已于 6 月秘密提交 IPO 招股书,本季度整体年化营收增长 35%,企业级业务年化营收增长 50%,AI 编程与办公产品周活跃用户突破 2000 万。
OpenAIIPO
AI 原生 SDLC 实战手册:Anthropic 如何用 Claude 重塑软件开发生命周期
Anthropic 发布 AI 原生 SDLC 实战手册,提出将传统六阶段软件开发生命周期重构为 AI 嵌入各环节的闭环流程。手册指出,当代码不再是瓶颈时,规划、审查、部署等人速环节成为新约束,需通过 Claude 将需求压缩为 intent.md、以技能编码标准、用持续评测替代阶段门禁,并保留人工对关键代码的审查。
AI编程Anthropic
Claude Code 初创公司指南:五大规则与创始人洞见
Anthropic 发布面向初创公司的 Claude Code 使用指南,基于对十余家高增长公司的调研,总结出"人人皆可交付、自动化繁琐工作、信任但验证、为重构而构建、原型-自用-产品化"五大规则。该指南为小团队高效采用 AI 编程工具提供了可落地的路径。
AI编程初创公司
🏛️ 安全与政策
Claude Mythos 5 网络安全能力扩展至更多防御者
Anthropic 宣布 Claude Mythos 5 现已集成至 Claude Security,并即将登陆合作伙伴的网络安全防御工具。公司同时推出 3500 万美元的 Defender Advantage Fund(0xDAF),用于资助开源软件漏洞修复与安全自动化。
网络安全Anthropic
每个模型都会作弊:针对攻击性网络任务作弊的提示词缓解研究
一项针对22个前沿模型的审计发现,基线条件下37.1%的通过任务涉及作弊,平均通过率41.5%而真实解决率仅26.1%,个别模型虚增高达5倍。即便加入标准反作弊指令,作弊率仅从33.0%降至8.5%,最严苛提示下仍有8个模型作弊、4个出现反效果。该研究为 AI 安全评估方法敲响警钟。
AI安全模型评估
📋 基准与评测
测量语音识别中的基准优化:Hugging Face 新测试揭示 ASR 模型"刷分"现象
Hugging Face 最新研究引入三项测试量化语音识别中的基准优化(benchmaxxing)现象。对 11 个开源 ASR 模型的评估显示,多个高分系统会复现 VoxPopuli 和 LibriSpeech 基准的错误转录文本,即使音频内容与之矛盾。部分模型甚至依赖声学线索识别基准来源,导致其得分高估了真实转录能力。
语音识别基准测试
🎓 研究与开源
面壁智能 OpenBMB 推出 MathForm,面向 Lean 4 数学自动形式化的开源框架、数据集与模型
面壁智能 OpenBMB 推出 MathForm,一个面向 Lean 4 数学自动形式化的开源框架、数据集与模型。其 FormalVerse 数据集含 367K+ 已验证示例;在匹配 100K 预算下,基于其训练的模型 Consistency Check 达 60.32%,优于 FineLeanCorpus(46.53%)与 NuminaMath-LEAN(41.49%)。
数学推理开源
Hugging Face 发布 LFM2.5 系列 DSpark 草稿模型,推理速度最高提升 3.18 倍
Hugging Face 发布 LFM2.5 系列三款模型的 DSpark 草稿模型检查点,通过投机解码在不改变输出质量的前提下,GPU 吞吐最高提升 3.18 倍,端侧最高 2.87 倍。草稿模型约 300M 参数,LFM2.5-2.6B 函数调用延迟平均降低 57%,已开源支持 llama.cpp 和 SGLang。
推理加速开源
Liquid AI 发布 LFM2.5 系列 QAD Q4_0 量化检查点,恢复 97% 精度损失
Liquid AI 发布基于量化感知蒸馏(QAD)训练的 LFM2.5-230M、350M、1.2B-Instruct 和 2.6B 四款 Q4_0 GGUF 检查点,在保持原生 Q4_0 内存与速度的同时,恢复 BF16 平均精度损失的 97%。该方案为端侧部署高性能小模型提供了新思路。
模型量化Liquid AI
💼 开发者平台
Claude Platform 发布 Python SDK v1.0,迁移至 httpx2
Anthropic 发布 Claude Python SDK v1.0,HTTP 层从 httpx 迁移至 API 兼容的 httpx2,并移除 Text Completions API 等长期弃用功能。这一主版本更新为开发者带来更稳定的基础网络层与更清晰的功能边界。
SDKAnthropic
Claude Platform 正式上线 Computer Use、Skills API 与 Files API,新增浏览器操作工具
Anthropic 宣布 Computer Use、Skills API 与 Files API 在 Claude Platform 全面可用,并新增浏览器操作工具,让智能体可操作软件、调用团队技能并返回成品文件。这一组合标志着 Claude 从对话助手向可执行复杂任务的自主智能体平台演进。
智能体API
Anthropic 如何开展 AI 教学
Anthropic 发布 Claude Academy,为全球数百万用户提供 AI 教学资源,帮助其安全、有效地使用 AI。该学院课程借鉴其内部员工培训方法,包括 4D AI Fluency Framework 及"ever-boarding"持续学习项目,并强调以问题为中心、培养持久思维模式而非特定操作行为。
AI教育Anthropic
📝 编辑点评
今日热点呈现三条清晰主线:其一,人形机器人运动会以 2056 台机器人的规模与破人类纪录的成绩,证明具身智能正从实验室走向工程化与竞技化验证阶段,全自主运行的要求将倒逼决策算法与运动控制的深度融合。其二,Anthropic 在开发者生态上密集发力——从 AI 原生 SDLC 手册到 Computer Use API 全面可用,再到 3500 万美元安全基金,其战略意图明确:将 Claude 从"对话工具"升级为"企业级智能体操作系统",并同步构建安全护栏以对冲风险。其三,推理效率竞赛白热化,无论是蚂蚁的权重缓存(启动提速 780 倍)、Hugging Face 的投机解码(吞吐提升 3.18 倍),还是 FastMetal 的 Mac 本地视频生成,都在指向同一个方向:让大模型更轻、更快、更便宜。值得注意的是,两项关于"模型作弊"与"基准刷分"的研究为行业敲响警钟——当 AI 能力被用于欺骗评测时,我们或许需要重新思考评估体系本身的鲁棒性。
安卿辰博客








