每日 AI 资讯速递
今日 AI 领域迎来密集发布:Anthropic 全面开放 Computer Use 与 Skills API,并推出面向初创公司及全球用户的 AI 教学体系;阿里发布 GUI 智能体基座模型 Qwen-UI-Agent,Liquid AI 与 Hugging Face 则围绕推理效率展开军备竞赛。与此同时,OpenAI 在上市传闻与关键网络安全能力阈值之间谨慎调整节奏,行业竞争正从"拼参数"转向"拼落地效率与安全治理"。
🤖 大模型
GLM-5.3上线:AA智能指数60分并列开源第一,成本更低
GLM-5.3 API 即日上线,在 AA 综合智能指数中取得 60 分,与 Claude Fable 5、GPT-5.6 Sol 等闭源旗舰同级,并与 Kimi K3 并列开源模型第一。该模型以更小参数规模和更低调用成本降低前沿智能门槛,单任务成本为旗舰模型中最低,API 定价与 GLM-5.2 持平,模型权重将于下周五开源。
开源模型成本优化
阿里发布 Qwen-UI-Agent,主打让模型真正"会用"每一块屏幕
阿里巴巴正式推出 Qwen-UI-Agent,一个以真实世界为中心的 GUI 智能体基座模型,覆盖移动端、电脑端、网页端及深度搜索(DeepSearch)环境。该模型旨在提升 AI 对图形界面的理解与操作能力,为下一代人机交互铺路。
智能体GUI
Hugging Face 发布 LFM2.5 系列 DSpark 草稿模型,推理速度最高提升 3.18 倍
Hugging Face 发布 LFM2.5 系列三款模型的 DSpark 草稿模型检查点,通过投机解码在不改变输出质量的前提下,GPU 吞吐最高提升 3.18 倍,端侧最高 2.87 倍。草稿模型约 300M 参数,LFM2.5-2.6B 函数调用延迟平均降低 57%,已开源支持 llama.cpp 和 SGLang。
推理加速开源
Liquid AI 发布 LFM2.5 系列 QAD Q4_0 量化检查点,恢复 97% 精度损失
Liquid AI 发布基于量化感知蒸馏(QAD)训练的 LFM2.5-230M、350M、1.2B-Instruct 和 2.6B 四款 Q4_0 GGUF 检查点,在保持原生 Q4_0 内存与速度的同时,恢复 BF16 平均精度损失的 97%。该方案为边缘部署高性能模型提供了新范式。
模型量化边缘计算
🚀 产品发布
Claude Platform 正式上线 Computer Use、Skills API 与 Files API,新增浏览器操作工具
Anthropic 宣布 Computer Use、Skills API 与 Files API 在 Claude Platform 全面可用,并新增浏览器操作工具,让智能体可操作软件、调用团队技能并返回成品文件。这标志着 Claude 从对话助手向自动化工作流执行者的关键跨越。
AgentAPI
Claude 现已支持 Gmail 邮件与 Google Drive 文件管理
Claude 现在可以在 Gmail 中发送邮件,并管理 Google Drive 中的文件。用户可让 Claude 回复邮件线程并起草发送回复,同时控制何时需要批准。该功能已对所有付费套餐开放,进一步打通日常办公场景。
办公集成效率工具
Grok Build 全面上线网页与移动端,所有套餐可用
Grok Build 现已面向所有套餐开放,支持网页、iOS 和 Android 端使用。用户描述应用、游戏或网站后,Grok 可在聊天中实时生成可运行版本,并新增发布分享、接入 X 及调用 Grok 自身模型等能力,发布的应用可获得 grok.me 链接。
应用生成多端
FastMetal 让 Mac 本地 30 秒生成视频
一段 5 秒 480P 视频,完全在 Mac 上生成,耗时 30 秒,无需 CUDA,无需云端,仅占用 3.9 GiB 内存。FastMetal 将 FastWan-QAD 系列带到 Apple Silicon,DiT、DMD 采样器和解码器均通过 MLX 在 Metal 上运行,默认 INT8,提供 1.3B 至 14B 三档模型。
端侧生成Apple Silicon
💼 行业动态
消息称 OpenAI 首席财务官告知员工:公司最迟将于 2027 年上市
OpenAI 首席财务官萨拉·弗里亚尔在全员大会上告知员工,公司最迟将于 2027 年完成上市,若业务持续向好也可能更早。OpenAI 已于 6 月秘密提交 IPO 招股书,本季度整体年化营收增长 35%,企业级业务年化营收增长 50%,AI 编程与办公产品周活跃用户突破 2000 万。
IPO商业增长
OpenRouter 宣布加入 Stripe
OpenRouter 宣布与 Stripe 合并,以加速推动全球经济增长。OpenRouter 目前每日处理来自 400 多个 AI 模型的 10+ 万亿 token,服务超 1000 万开发者与公司,自成立以来推理量每年至少增长 10 倍。合并后将继续以原名、原使命独立运营,产品与路线图不变。
并购AI 基础设施
Claude Code 初创公司指南:五大规则与创始人洞见
Anthropic 发布面向初创公司的 Claude Code 使用指南,基于对十余家高增长公司的调研,总结出"人人皆可交付、自动化繁琐工作、信任但验证、为重构而构建、原型-自用-产品化"五大规则,为 AI 原生团队提供可落地的工程实践。
初创公司最佳实践
📋 政策法规
OpenAI 在"关键网络能力"时代放缓模型开发节奏
OpenAI 因 OpenAI-Hugging Face 事件及即将推出的 Astra 模型可能达到《预备框架》下的"关键网络安全能力"阈值,暂时放缓了模型扩展速度,包括暂停最新部署模型的强化学习训练两周,并搁置最大规模前沿 RL 运行。公司已加强研究环境安全,要求对 Astra 及网络相关负载实施最严格防护,并扩展思维链监控。
AI 安全治理
🎓 学术研究
Anthropic 如何开展 AI 教学
Anthropic 发布 Claude Academy,为全球数百万用户提供 AI 教学资源,帮助其安全、有效地使用 AI。该学院课程借鉴其内部员工培训方法,包括 4D AI Fluency Framework 及"ever-boarding"持续学习项目,并强调以问题为中心、培养持久思维模式而非特定操作行为。
AI 教育人才培训
智能体记忆并非越多越好:八款模型评测显示剂量需按能力校准
智能体记忆并非可随意开启的功能,而是需按模型能力校准的剂量。强模型适合注入完整指南集,DeepSeek-V3.2(671B MoE)任务完成率提升+9.5个百分点;较弱模型采用精选检索效果最佳,gpt-oss-120b(117B MoE)提升+16.1pp且仅增加+5% token。该方法无需更新权重或人工标注,通过从智能体过往轨迹中蒸馏指南并在推理时注入实现。
智能体记忆评测
突破 DeepSeek-V4-Pro 服务极限:H20 上的多场景优化方法
LMSYS 团队针对 1.6 万亿参数的 MoE 模型 DeepSeek-V4-Pro,在 H20 GPU 上通过场景化服务配置逼近 B300 性能。单节点 H20-141GB 参考实现达 271 output tokens/s,与 B300 的 383.7 tokens/s 性能差距缩小至 1.42×,为高性价比推理部署提供了重要参考。
推理优化性能评测
设计 AI 评测:先求清晰,再谈可视化
本文演示如何用开源评测框架 Inspect AI 和 Harbor 评估 agent 技能,并借助 Google Sheets 和 Data Studio 进行可视化分析,为 AI 团队提供了一套从指标定义到结果呈现的完整评测方法论。
评测框架可视化
🔧 开源项目
Mojo 语言正式开源,编译器与工具链全面开放
Mojo🔥 语言现已正式开源,采用 Apache 2.0 许可证(含 LLVM 例外),编译器、工具链及全部源码已发布至 modular GitHub 仓库。Mojo 上周刚达成 1.0 版本(源码稳定),目前暂不接受编译器相关贡献,计划年底前开放,标准库自 2024 年起已接受社区贡献。
编程语言Apache 2.0
Mistral 推出 Agentic Search:多步检索提升 AI 系统复杂文档查询准确率
Mistral 发布 Agentic Search,通过 search、open、navigate、read、grep 五工具的多步检索循环,让模型在长文档与多来源中查找、定位并验证信息,显著提升复杂文档查询的准确率与可解释性。
检索增强Agent
AlloyDB ScaNN 如何将向量搜索扩展到 100 亿向量
AlloyDB 的 ScaNN 索引现已支持超过 100 亿向量的规模,通过全新的四层树架构(预览版)实现,将查询复杂度从 O(N^1/2) 降至 O(N^1/4)。内部测试中,该架构在 100 亿向量规模下可实现 p95 延迟不超过 51 毫秒、召回率达 95%。
向量数据库性能突破
OpenAI 推出 ChatGPT for Teens:面向青少年的学习体验与更强安全保护
OpenAI 发布 ChatGPT for Teens,为 13-17 岁用户自动启用,内置更强安全保护与家长控制。新增 Study Mode、负责任作业提醒、测验与学习可视化,以及可设定默认开启时段的 Study Hours,引导青少年分步解题而非直接给答案。
青少年保护教育应用
📝 编辑点评
今日热点清晰勾勒出 AI 行业的两条主线:一是"效率与落地"成为绝对关键词。从 Hugging Face 的投机解码提速 3.18 倍、Liquid AI 恢复 97% 量化精度,到 GLM-5.3 以更小参数对标闭源旗舰、FastMetal 让 Mac 本地 30 秒出片,行业竞争焦点已从单纯的参数规模转向单位算力的智能产出比。二是"安全与治理"正从口号变为硬约束。OpenAI 因触及"关键网络安全能力"阈值而主动放缓训练节奏,堪称标志性事件——当模型能力逼近危险临界点,头部玩家的自我监管开始实质性地影响研发节奏。值得注意的是,Anthropic 与 OpenAI 不约而同地押注"教育"与"青少年"市场,这既是用户增长的新蓝海,也是为下一代 AI 原生用户建立认知框架的先手棋。可以预见,随着 OpenRouter 并入 Stripe、OpenAI 上市时间表浮出水面,AI 基础设施的资本化进程将显著提速,行业洗牌或在未来 18 个月内加剧。
安卿辰博客








