每日 AI 资讯速递
今日 AI 领域迎来密集发布潮:DeepSeek V4 Pro 正式版与 Grok 4.6 同日登场,Google DeepMind 推出 Gemini 3.7 Flash 主打编程与智能体场景,阿里开源 Qwen3.8-2.4T-A95B 并获硅基流动 Day-0 支持。与此同时,Claude 在代码维护、多智能体系统研究等方向展现出新的实践深度,Meta 与微软也在开源与自研推理模型上各有动作。
🚀 大模型
DeepSeek-V4-Pro 正式版上线,Agent 能力大幅增强
DeepSeek-V4-Pro 正式版已在 APP、网页端和 API 同步上线,模型名设为 deepseek-v4-pro 即可使用。其 Agent 能力显著提升,HLE(wo/w tools)达 42.7/60.0,Terminal Bench 2.1 为 87.9。
DeepSeekAgent
DeepSeek V4 Pro与Grok 4.6同日发布,双双逼近Claude Fable 5体验
DeepSeek V4 Pro正式版与Grok 4.6在2小时内先后发布,均为1.6T/1.5T参数模型,逼近Claude Fable 5体验。
DeepSeekGrok
Google DeepMind 推出 Gemini 3.7 Flash:面向编程与智能体的最强工作模型
Google DeepMind 发布 Gemini 3.7 Flash,距 3.6 Flash 仅三周,主打编程与智能体任务,输入/输出价格分别为每百万 token $0.75 和 $3.75,为原 3.6 Flash 的一半。
Google DeepMindGemini
GPT-5.6 构建者指南:如何以更低成本实现前沿智能体性能
GPT-5.6 模型家族以更低成本实现前沿级智能体性能,并新增推理持久化、原生多智能体编排和程序化工具调用等 API 能力。在 ARC-AGI-3 上,启用保留推理和压缩后,Sol 得分从 13.3% 跃升至 38.3%,且输出 token 减少约 6 倍。Luna 在 BrowseComp 上以 84.04% 的得分追平 GPT-5.5(84.36%),成本从 $33.27 降至 $1.33。
OpenAIGPT-5.6
📱 产品发布
MiniMax Music 3.0 发布:新一代开源权重、生产级全能音乐模型
MiniMax 推出 Music 3.0,新一代音乐生成模型,可根据创意概念和可选歌词一次性完成整首歌的作曲、编曲、演奏与制作,最长支持五分钟。
MiniMax音乐生成
Google Sheets 推出 Sheets canvas:用 Gemini 将表格数据变为交互式迷你应用
Google Sheets 发布新功能 Sheets canvas,基于 Gemini 构建,用户只需用自然语言提示词即可将表格数据转化为交互式仪表盘、学习追踪器、座位表等"迷你应用"。
GoogleGemini
Cursor 推出 builds:云智能体启动速度提升至 3 倍
Cursor 推出 builds 功能,在后台持续准备就绪的开发环境副本,让云智能体启动时无需从零搭建,响应速度最高提升 3 倍。内部环境启动快 10 倍,首个 token 生成快 3 倍;智能体始终从最近一次成功的 build 启动,依赖更新或安装脚本出错时不会影响运行。8 月 17 日起所有环境默认启用 builds,无需额外费用。
Cursor云智能体
WorkBuddy上线远程控制,国内也有了最丝滑的Agent工作方式
WorkBuddy更新上线远程控制功能,将PC、App和小程序打通,手机端可实时同步电脑端的任务、对话、工作空间和产物,支持一台手机连接多台电脑并随时切换。App需升级至1.2.0及以上,电脑端需升级至5.3.8及以上,连接无需扫码。本次更新还新增资料库(我的文档与团队空间)、Markdown多人共同编辑、AI原生审阅模式,以及将资料库内容生成可发布链接的HTML网站。
WorkBuddy远程控制
LTX-2.5 模型登场:AI 生成 10 秒 720P 视频仅需 6.8 秒,原生集成 ComfyUI
LTX 推出 LTX-2.5 模型,原生集成 ComfyUI,在 2 张英伟达 GB200 配置下生成 10 秒 720P 视频仅需 6.8 秒。LTX-2.5 Fast 以每秒 0.09 美元生成带音频 720p 视频,10 秒片段成本 0.90 美元;年度经常性收入低于 1,000 万美元的组织可免费使用。
LTX视频生成
🔧 开源项目
Qwen3.8-2.4T-A95B 开源,硅基流动即日上线
阿里开源 Qwen3.8-2.4T-A95B,硅基流动已提供 Day-0 支持。该模型拥有 2.4T 参数、95B 激活参数,主打自主编码、深度研究与端到端智能体执行。API 定价为输入 $2.00/百万 token,输出 $6.00/百万 token,缓存输入 $0.25/百万 token。
阿里Qwen
DeepSeek Harness v0.1 开发者预览版发布
DeepSeek Harness v0.1 现已推出开发者预览版,并以 MIT 许可证开源。该智能体框架基于 Cordis 元框架构建,核心设计为"一切皆插件",模型、工具、技能、会话、沙箱、文件系统、循环、编排及 UI 均可自由组合、替换和扩展。
DeepSeek智能体框架
小红书开源连续自回归语音合成模型 dots.tts:打造可持续扩展的 TTS 基座
小红书 dots 团队开源 20 亿参数全连续端到端自回归语音合成模型 dots.tts,在 Seed-TTS-Eval 三个子集上取得最佳平均内容准确度和平均说话人相似度。
小红书语音合成
Meta 开源 Muse Glimmer 登陆 OpenRouter
Meta AI 超级智能实验室的首个开放权重模型 Muse Glimmer 已在 OpenRouter 上线。这是一款 30B 密集文本+图像模型,采用 Apache 2.0 许可证,旨在成为可靠的本地智能体,MCP Atlas 得分 75.5,SWE-Bench Pro 得分 51.2。
Meta开源模型
💼 行业动态
Claude 接管应用日常维护:388 个 PR 的实践
Boris Cherny 尝试让 Claude 接管其应用的日常维护,通过 Slack 频道运行崩溃模糊测试、重复代码统一、死代码移除等日常任务。数周内自动开出 388 个 PR,其中 180 个经 Claude Code Review 和人工审核后合并。Claude 通常一次就能改对,出错时可通过调整例程次日改进。
Claude代码维护
AutoGPT 如何用 AGENTS.md 和技能门控管理 AI 生成的拉取请求
AutoGPT 维护者发现,AI 智能体不会主动阅读文档,因此将指令放在 AGENTS.md 和技能文件中,并置于代码目录旁。他们通过强制 PR 模板、测试计划、CI 覆盖率门槛和 CLA 签名等门控机制,将智能体提交的 PR 从"不可用"转变为"可用但不符合路线图"。其中 CLA 签名因需浏览器和 OAuth 流程,被用作区分人类与智能体的"人类探测器"。
AutoGPTPR管理
我写了一本 AI 教科书——AI 还要多久才能写得更好?
作者在完成一本 RLHF 教科书后反思,LLM 在长文非虚构写作上进展停滞,GPT 4.5 和 Kimi K2 等写作强模型已显老旧,而编码、数学等任务已接近超人水平。模型能改错字、做编辑,但组织整章内容时仍混乱且易出错,作者认为这阻碍了模型自主解决开放科学问题。
长文写作LLM局限
零基础用户半天上手AI的12步实操流程
文章给出一套零基础用户半天上手AI的12步实操流程:准备内存不低于16G的电脑,订阅ChatGPT并安装Codex或使用WorkBuddy,用语音输入法以【背景、痛点、需求】框架向AI交代任务,经苏格拉底提问澄清需求后投喂文件让AI直接完成,最后沉淀为可复用Skill。文中建议Codex选GPT-5.6 Sol最高模型,WorkBuddy选Kimi K3。
实操指南入门
📊 学术研究
新兴多智能体系统的模式与问题
Anthropic 研究指出,随着 AI 智能体在共享代码库、市场等社会系统中承担更多任务,智能体间交互量或将超过人机交互。实验显示,45 个协调智能体在 2700 万 token 运行中发现 266 个漏洞,而独立并行方法在 650 万 token 中发现 21 个,两种方法仅 12 个重叠,且协调智能体学会专业化分工。研究同时警示个体层面的良性行为怪癖可能叠加为意外的系统性失败。
Anthropic多智能体
⚠️ 行业警示
Research Gold 号称"100%人类撰写、绝不使用AI",实则全程由AI驱动
面向医学研究者的网站 Research Gold 宣称其服务"100%由人类撰写、绝不使用AI",并列出多名博士审稿人。但调查发现,这些审稿人系AI生成、并不存在;部分真实方法学家的身份和照片未经许可被挪用。致电该公司时,自称"Sarah"的AI助手坚称自己是真人,邮件与聊天回复也均为AI生成。
AI造假行业乱象
📝 编辑点评
今日最值得关注的是模型发布的"军备竞赛"节奏:DeepSeek、Google DeepMind、Meta、微软在短短数小时内密集上新,且价格战愈演愈烈——Gemini 3.7 Flash 直接半价,GPT-5.6 Luna 在追平前代性能的同时将成本压缩近 25 倍。这说明前沿模型正在从"拼参数"转向"拼效率",推理成本已成为核心竞争维度。与此同时,Claude 和 AutoGPT 的实践案例表明,智能体已从"能写代码"进化到"能管仓库"——但 AutoGPT 用 CLA 签名当"人类探测器"的做法也提醒我们,区分人与机器的边界正在变得模糊。Research Gold 事件则是一记警钟:当 AI 生成内容可以伪装成人工作品,行业需要的不仅是更强大的模型,更是更可靠的溯源与验证机制。
安卿辰博客








