每日 AI 资讯速递
今日 AI 行业迎来开源与产品双爆发:通义千问兑现承诺开源 Qwen3.8 系列,DeepSeek V4 Pro 正式版与开发者预览版齐发,小红书连开两弹(dots3-note 与 dots.tts);同时,Google 密集更新 Gemini 3.7 Flash 与 Sheets canvas,Cursor 被 SpaceX 收购并推出 builds 加速功能,Anthropic 则为合规引入文本水印机制。行业竞争焦点正从参数竞赛转向智能体效率与合规落地。
🚀 大模型
通义千问开源 Qwen3.8 系列模型
Qwen3.8-27B 为原生多模态稠密模型,仅 27B 参数即全面超越 Qwen3.7-Plus,原生支持 262K 上下文,可通过 YaRN 扩展至 1M tokens。Max 级 Qwen3.8-2.4T-A95B 的开放权重也已同步发布,采用 Apache 2.0 许可。
开源多模态
GLM-5.3 发布:编程能力开源第一,并涌现网络安全能力
智谱 GLM-5.3 基于与 5.2 相同基座,通过极致后训练 Scaling 提升智能上界,编程能力较前代提升 50%,在 Terminal Bench 3.0 中取得开源第一并接近 Claude Fable 5。模型在 CyberGym 测试中得分 84.5%,白盒代码审查表现持平 Mythos 5,权重将在两周后开源。
编程安全
DeepSeek-V4-Pro 正式版上线,Agent 能力大幅增强
DeepSeek-V4-Pro 正式版已在 APP、网页端和 API 同步上线,模型名设为 deepseek-v4-pro 即可使用。其 Agent 能力显著提升,HLE(wo/w tools)达 42.7/60.0,Terminal Bench 2.1 为 87.9。
Agent正式版
DeepSeek V4 Pro 登陆硅基流动,1M 上下文
DeepSeek-V4-Pro-0813 在 SiliconFlow 提供 Day-0 支持,具备 1M 上下文窗口及三档推理强度,侧重编码、工具调用与智能体工作流,仍保持 MIT 开源协议。定价为输入 $1.32/M、输出 $3.96/M、缓存命中 $0.44/M。
1M上下文API
Qwen3.8-2.4T-A95B 开源,硅基流动即日上线
阿里开源 Qwen3.8-2.4T-A95B,硅基流动已提供 Day-0 支持。该模型拥有 2.4T 参数、95B 激活参数,主打自主编码、深度研究与端到端智能体执行。API 定价为输入 $2.00/百万 token,输出 $6.00/百万 token。
MoE智能体
📱 产品发布
Gemini 3.7 Flash 全面上线 Pro 与 Ultra 用户
Gemini 3.7 Flash 现已向 Pro 和 Ultra 用户开放,更新提升了多步骤任务的推理与准确性,如智能整合数十个文件和邮件为一份主文档。Gemini Spark 也已运行于 3.7 Flash,通过改进对 Workspace 应用的工具调用,让个人 AI 智能体更精准。
GeminiWorkspace
Google DeepMind 推出 Gemini 3.7 Flash:面向编程与智能体的最强工作模型
距 3.6 Flash 仅三周,Gemini 3.7 Flash 主打编程与智能体任务,输入/输出价格分别为每百万 token $0.75 和 $3.75,为原 3.6 Flash 的一半。性能提升的同时大幅降价,性价比优势显著。
编程降价
Google Sheets 推出 Sheets canvas:用 Gemini 将表格数据变为交互式迷你应用
Google Sheets 发布新功能 Sheets canvas,基于 Gemini 构建,用户只需用自然语言提示词即可将表格数据转化为交互式仪表盘、学习追踪器、座位表等"迷你应用"。这标志着办公软件从数据处理向应用生成的范式转变。
办公自然语言
Cursor 推出 builds:云智能体启动速度提升至 3 倍
Cursor 推出 builds 功能,在后台持续准备就绪的开发环境副本,让云智能体启动时无需从零搭建,响应速度最高提升 3 倍。内部环境启动快 10 倍,首个 token 生成快 3 倍,8 月 17 日起所有环境默认启用且无需额外费用。
云开发提速
⚡ 行业动态
Cursor 正式被 SpaceX 收购
Cursor 已被 SpaceX 正式收购,完成自 4 月启动的收购流程。合并后 Cursor 将获得全球最大 GPU 集群,以构建更强且运行成本更低的模型。本周三发布的 Grok 4.6 是双方合作成果的早期体现。
并购GPU集群
OpenAI and Anthropic in price war as Chinese AI rivals gain ground
随着中国 AI 竞争对手的崛起,OpenAI 和 Anthropic 正陷入价格战。这一趋势反映全球 AI 市场竞争格局的深刻变化,中国模型在性能和定价上的双重突破正在重塑行业生态。
价格战竞争
2026年夏季开源模型生态观察:中国前沿模型规模领先,AMD与NVIDIA主导发布量
2026年1至8月,Hugging Face公开模型仓库从243万增至296万,但85.6%的模型下载量不足200次,1.5%的仓库占据99.2%下载量。中国实验室月度最大开源模型参数规模在754B至2.78万亿之间,远超美国实验室(七个月中五个月低于130B)。AMD 与 NVIDIA 各发布超 200 个新模型仓库。
生态开源
Claude 文本水印机制如何运作
未来 Claude 模型生成的文本将包含水印,用于判断文本由 Claude 撰写的可能性,这是 Anthropic 为遵守欧盟《AI 法案》而实施的变更。该方法基于 Google DeepMind 的 SynthID-Text 技术,对输出质量、创造力和可读性无实际影响,且不增加额外 token 或成本。
合规水印
🔧 开源项目
dots3-note Preview 开源:280B 参数轻量模型,主打长程智能体与多模态推理
小红书技术开源 dots3-note Preview,这是 dots3 系列最轻量模型,总参数 280B、激活参数 16B,支持 512K 上下文及文本、视觉、语音多模态理解,并针对复杂推理和长程 Agent 任务优化。
多模态Agent
DeepSeek Harness v0.1 开发者预览版发布
DeepSeek Harness v0.1 现已推出开发者预览版,并以 MIT 许可证开源。该智能体框架基于 Cordis 元框架构建,核心设计为"一切皆插件",模型、工具、技能、会话、沙箱、文件系统、循环、编排及 UI 均可自由组合、替换和扩展。
框架插件化
小红书开源连续自回归语音合成模型 dots.tts:打造可持续扩展的 TTS 基座
小红书 dots 团队开源 20 亿参数全连续端到端自回归语音合成模型 dots.tts,在 Seed-TTS-Eval 三个子集上取得最佳平均内容准确度和平均说话人相似度。该模型为 TTS 领域提供了可持续扩展的基座方案。
语音合成端到端
从0到1带你速通DeepSeek Harness
DeepSeek Harness 作为新发布的智能体框架,其"一切皆插件"的设计理念正在吸引开发者关注。该教程旨在帮助开发者快速上手这一基于 Cordis 元框架构建的开源工具。
教程上手
💡 应用实践
Claude 接管应用日常维护:388 个 PR 的实践
Boris Cherny 尝试让 Claude 接管其应用的日常维护,通过 Slack 频道运行崩溃模糊测试、重复代码统一、死代码移除等日常任务。数周内自动开出 388 个 PR,其中 180 个经 Claude Code Review 和人工审核后合并,Claude 通常一次就能改对。
AI编程自动化
蚂蚁百灵与 ASystem 团队打通单机 Agentic RL 后训练闭环
蚂蚁百灵与 ASystem 团队合作,用 Ling-3.0-tiny 和 AReno 在 DGX Spark 上跑通单机 Agentic RL 后训练闭环。以井字棋为最小验证任务,用 GSPO 算法训练 400 步后,rollout/rewards_mean 从约 -0.5 升至 0.4,response_len 降至约 850 tokens,工具调用与动作选择趋于稳定。
强化学习单机
GPT-5.6 构建者指南:如何以更低成本实现前沿智能体性能
GPT-5.6 模型家族以更低成本实现前沿级智能体性能,并新增推理持久化、原生多智能体编排和程序化工具调用等 API 能力。在 ARC-AGI-3 上,启用保留推理和压缩后,Sol 得分从 13.3% 跃升至 38.3%,且输出 token 减少约 6 倍;Luna 在 BrowseComp 上以 84.04% 追平 GPT-5.5(84.36%),成本从 $33.27 降至 $1.33。
成本优化多智能体
📝 编辑点评
今日热点呈现出三个清晰趋势:其一,开源模型进入"规模与效率并重"的新阶段——Qwen3.8 系列与 DeepSeek V4 Pro 在保持超大参数的同时,通过 MoE 架构和 1M 上下文窗口强化 Agent 场景,中国实验室在开源生态中的主导地位进一步巩固。其二,价格战从 API 定价蔓延至全栈——Gemini 3.7 Flash 半价发布、GPT-5.6 成本骤降 96%,而 Cursor 被 SpaceX 收购后获得 GPU 集群优势,竞争维度已从模型能力扩展到基础设施成本。其三,合规与实用主义并行——Claude 水印机制为欧盟 AI 法案落地提供范本,而 Claude 自动维护 388 个 PR 的实践则证明 AI 已能承担生产级代码维护任务。值得关注的是,小红书连续开源 dots3-note 与 dots.tts,显示垂直领域玩家正通过开源构建生态壁垒。整体而言,行业正从"拼参数"转向"拼落地成本与合规适配",开发者应重点关注开源模型的工具链成熟度与 API 定价策略变化。
安卿辰博客








