每日 AI 资讯速递
今日 AI 行业迎来密集发布潮:OpenAI 向全体 ChatGPT 用户推送 GPT-6 与 Intelligent UI,Anthropic 则以 Claude Haiku 5.5 和缓存降价双线出击,模型能力与成本效率同步跃升。与此同时,Perplexity、Liquid AI、微软研究院密集开源多模态嵌入、决策模型与智能体 RL 框架,AI Agent 的基础设施竞赛正从模型层向工具链与训练范式全面延伸。
🤖 大模型发布
OpenAI 向全部 ChatGPT 用户推出 GPT-6 与 Intelligent UI
OpenAI 正式向更广泛的用户群体发布 GPT-6,并随之上线 Intelligent UI——ChatGPT 可动态生成图形、按钮、表单、图表和可交互组件来回答问题。这标志着 ChatGPT 从纯文本对话界面向生成式交互界面迈出关键一步,AI 输出形态从"回答"进化为"可操作的应用"。
GPT-6ChatGPT交互界面
GPT-6 Luna Decisions 上架 OpenRouter,决策速度提升 10 倍
OpenRouter 宣布 GPT-6 Luna Decisions 上线。其 Decisions API 可让应用选择合适的模型、工具或动作,支持文本、JSON 或图片输入并返回带概率的类型化答案。定价为输入 $0.10/M、输出免费,上下文窗口达 1M;据 OpenAI 开发者账号称,其决策速度比通过 Responses API 调用 GPT-6 Luna 最快提升 10 倍。
OpenAIOpenRouterAPI
Anthropic 发布 Claude Haiku 5.5,智能指数得分 43
Anthropic 发布 Claude Haiku 5.5,在 Artificial Analysis 智能指数上得分 43,较上一代 Haiku 在一年内提升了 26 分。这一跃升幅度在轻量级模型中极为罕见,表明小模型的能力天花板正在被快速推高,对边缘部署和低成本推理场景意义重大。
AnthropicClaude Haiku基准测试
Mistral Large 4 进入 Code Arena: WebDev,排名第 45
Mistral Large 4 登陆 Code Arena: WebDev,以 1534 分排名第 45,比 Mistral Large 3(第 130 名)高出 304 分,比 Mistral Medium 3.5 高 271 分。虽然排名尚未进入第一梯队,但代际提升幅度显著,显示 Mistral 在代码生成领域的持续投入正在见效。
Mistral代码生成基准测试
⚡ 产品与平台更新
Claude Code v2.1.293 发布:新增 Claude Haiku 5.5 支持
Claude Code 发布 v2.1.293,新增 claude-haiku-5-5 作为 Anthropic API 默认 Haiku 模型,支持 1M 上下文,价格为 $0.10/$0.50 每百万 token(超 100K 提示为 $0.50/$2.50),同时修复了大量已知问题。开发者可在编码工作流中直接调用最新轻量模型,兼顾速度与成本。
Claude Code开发工具版本更新
Cursor 公布 Claude Haiku 5.5 定价并下调 Sonnet 5.5 缓存读取价格
Cursor 公布 Claude Haiku 5.5 定价为每 M 输入 token $0.10、输出 token $0.50,输入超 100k token 时升至 $0.50/M 和 $2.50/M。同时 Claude Sonnet 5.5 缓存读取价格从 $0.20/M 降至 $0.10/M,用户可在 cursor.com/evals 通过 CursorBench 对比 Haiku 5.5 表现。缓存降价对高频调用场景的成本优化尤为明显。
Cursor定价缓存优化
Anthropic 为 Claude Max 和 Team 套餐推出月度 Platform API 额度
Anthropic 正在为 Claude Max 和 Team 套餐推出月度 Claude Platform API 额度:Max 5x 为 $100,Max 20x 为 $200,Team 最多 $500 且可共享。额度适用于任何模型(包括 Haiku 5.5),可在自有代码或第三方 harness 中使用。这一举措将订阅与 API 消费打通,降低了开发者在 Anthropic 生态内的迁移成本。
AnthropicAPI 额度订阅套餐
Anthropic 将 Claude Sonnet 5.5 缓存读取价格减半至 $0.10/M
Anthropic 宣布将 Claude Sonnet 5.5 的缓存读取价格减半,降至每百万 token $0.10。官方称这使 Sonnet 5.5 在多数长期运行任务上的运行成本降低约 20%。对于需要频繁读取系统提示和上下文的长会话 Agent 场景,这一降价直接降低了生产部署的边际成本。
Anthropic降价缓存
NVIDIA 与 Microsoft 发布 RTX Spark 及 DGX Station for Windows
NVIDIA 与 Microsoft 在旧金山 Windows AI 和 Surface 活动上宣布为 Windows PC 引入 AI Agent 硬件与软件方案,推出 RTX Spark 及 DGX Station for Windows。这意味着 AI Agent 的本地推理能力将从云端下沉到个人电脑,为隐私敏感和低延迟场景提供新的部署选项。
NVIDIAMicrosoftAI PC
Google 发布 Developer Knowledge API 生态,为 AI 智能体提供官方文档检索
Google 推出 Developer Knowledge API 生态,作为 Google Cloud、Firebase、Android 等开发者文档的官方程序化来源。该 API 以结构化接口和 Markdown 格式文档取代网页抓取,支持语义与关键词搜索、文档分块和有依据的问答。对构建编码 Agent 的团队而言,这提供了一条绕过非结构化网页解析的可靠文档获取通道。
Google开发者工具API
🔧 开源与工具链
Perplexity 开源 pplx-embed-v2-late 多模态嵌入模型(9B 与 0.6B)
Perplexity 开源 pplx-embed-v2-late,包含 9B 和 0.6B 两个 late-interaction 多向量嵌入模型,共享同一嵌入空间,权重已在 Hugging Face 提供。9B 可用于索引多模态数据,0.6B 可在设备端查询,无需 OCR 即可检索 PDF 页面。模型在 MADQA 得分 92.4%,BrowseComp+ 得分 64%,展示了多模态检索在文档理解场景的强劲表现。
Perplexity开源多模态嵌入
Unsloth 开源教程:本地训练 Qwen3.5 0.8B 决策模型,准确率从 20.7% 提升至 74.3%
Unsloth 发布教程与开源仓库,可将 Qwen3.8、Gemma 4 等 LLM 微调为输出选项概率的决策模型。Qwen3.5 0.8B 在 3 个决策基准上的合计准确率从 20.7% 提升至 74.3%,仅需 4GB 显存。这一方案大幅降低了决策模型微调的硬件门槛,使消费级 GPU 也能完成高质量微调。
Unsloth开源微调
Microsoft Research Asia 开源 Agent Lightning v1.0:3,500 行代码的智能体 RL 训练框架
微软亚洲研究院提出 Harnessed Agentic RL 训练范式并开源重建的 Agent Lightning v1.0,让部署时使用的同一 agent harness 直接参与强化学习,无需在训练框架内重写 agent。整个框架仅 3,500 行代码,显著降低了智能体 RL 训练的工程复杂度,有望加速 Agent 能力的迭代闭环。
微软研究院开源强化学习
LangChain 重构 Deep Agents 的 Skills 支持,新增工具绑定与线程内重载
LangChain 重构 Deep Agents 的 Skills 支持,针对企业技能库增至数千个技能的场景推出三项更新:工具可绑定到技能并仅在技能被读取时加载;用户可通过 /meeting-prep 之类的显式请求固定技能以在首次模型调用前加载;长线程可通过将 skills_metadata 设为 None 重载新增或变更的技能。这些改进直接回应了大规模技能库下的上下文窗口压力和动态更新需求。
LangChainAgent技能管理
Liquid AI 发布开源决策模型 d1-3B 和 d1-omni-600M
Liquid AI 发布开源权重决策模型 d1-3B 和 d1-omni-600M,已在 Hugging Face 上提供。其中 d1-omni-600M 以极小参数量覆盖多模态决策场景,延续了 Liquid AI 在高效架构上的一贯路线。两款模型的发布进一步丰富了开源决策模型的选择空间。
Liquid AI开源决策模型
vLLM 详解 DeepSeek-V4.1-Flash 优化:Agent 场景吞吐提升 5 倍
Inferact 与 vLLM 社区在 DeepSeek-V4.1-Flash 发布三周内完成优化,低并发速度提升 1.9 倍,150 TPS 约束下吞吐提升 5.3 倍。这些优化针对 Agent 场景的高并发、长上下文特征进行了专门调优,对依赖 vLLM 部署 DeepSeek 模型的生产团队具有直接的性能参考价值。
vLLMDeepSeek推理优化
🎓 学术与研究
Nemotron 系列微调后达到 IOI 2026 与 IMO 2026 金牌水平
NVIDIA Nemotron 团队基于 Nemotron 3,通过 SFT、RL 和反馈驱动推理分别构建了在 IOI 2026 与 IMO 2026 达到金牌水平的系统。这一成果表明,通过针对性的后训练策略,中等规模基础模型也能在顶级竞赛级推理任务上达到人类金牌选手水平,为推理能力的工程化提升提供了可复现的路径。
NVIDIA推理能力竞赛基准
🏛️ 政策与法规
亚利桑那州法院裁定 AI 生成受害者视频带有不当情感分量,将重新量刑
亚利桑那州上诉法院裁定,Gabriel Horcasitas 2021 年路怒枪杀 Christopher Pelkey 一案维持过失杀人定罪,但因量刑听证中播放的 AI 生成受害者视频带有不当情感分量,法官须重新考虑刑期。这是司法系统对 AI 生成内容在法庭程序中使用边界的一次重要表态,可能为后续类似案件确立参考标准。
AI 法规司法AI 生成内容
Google 开放 SynthID Detector 门户,可检测图片、视频和音频是否由 AI 生成
Google 推出 SynthID Detector 门户,用户访问 synthid.com 上传图片、视频或音频文件,即可扫描文件是否包含来自 Google 或其合作伙伴的 SynthID 水印。该工具将 AI 内容检测能力从研究阶段推向公众可用,为内容真实性验证提供了基础设施级支持,但检测范围目前仍限于 SynthID 生态内的水印。
GoogleAI 水印内容检测
💼 行业动态
a16z 解析德州为何让数据中心排队等电
a16z 的 Ryan McEntush 分析德州电网暂停审批数据中心的原因:并网队列从 2024 年底的 63 GW 激增到今年 6 月的 474 GW,约 90% 是数据中心,开发商大量投机性申请且社区沟通不足。这一数据揭示了 AI 算力扩张与能源基础设施之间的结构性矛盾,电网接入正成为比芯片供应更紧迫的瓶颈。
数据中心能源基础设施
📝 编辑点评
今日最值得关注的信号是"决策模型"这一品类的集体爆发:OpenAI 的 GPT-6 Luna Decisions、Liquid AI 的 d1 系列、Unsloth 的 Qwen3.5 决策微调教程,三条新闻从闭源 API、开源权重、社区教程三个层面同时指向同一个方向——让模型输出带概率的选项而非自由文本。这意味着 AI 应用架构正在从"生成后解析"转向"原生决策",Agent 的可靠性问题有望从提示工程层面下移到模型能力层面得到根本改善。
另一个显著趋势是 Anthropic 的价格策略组合拳:Haiku 5.5 以 $0.10/M 的输入价格提供 43 分智能指数,同时将 Sonnet 5.5 缓存读取价格减半,再配合 Max/Team 套餐的 API 额度打通。这套组合的意图很明确——用轻量模型抢占高频调用场景,用缓存降价锁定长会话 Agent 工作负载,用订阅额度降低开发者迁移摩擦。在 OpenAI GPT-6 全面铺开的压力下,Anthropic 选择以成本效率和开发者体验作为差异化壁垒。
基础设施层面,微软研究院的 Agent Lightning v1.0 和 vLLM 的 DeepSeek 优化共同指向一个事实:Agent 的训练与推理工具链正在快速成熟。3,500 行代码的 RL 框架让"部署即训练"成为可能,而 5 倍吞吐提升则让 Agent 场景的经济性大幅改善。当模型能力、训练范式和推理效率三条曲线同时上扬,2026 年下半年的 Agent 落地速度可能超出多数人的预期。
安卿辰博客








