每日 AI 资讯速递
今日 AI 行业迎来罕见的"模型与监管双爆点":OpenAI GPT-6.1 Sol 以五分之一价格逼近旗舰编码能力,Google DeepMind Gemini 4 Argon 抢先向网络防御者开放,Arena 榜单同步刷新;与此同时,白宫超级智能协定落地、FTC 对头部实验室启动法律约束力调查,安全与商业化之间的张力被推到台前。
🤖 大模型前沿
OpenAI 发布 GPT-6.1 Sol:以 Astra 五分之一价格接近其编码与计算机操作水平
OpenAI 推出 GPT-6.1 Sol,定价为每百万 token 输入 2 美元、输出 10 美元、缓存输入 0.10 美元,约为 GPT-6 Astra 标准价格的五分之一。该模型在编码与计算机操作任务上被官方描述为"接近 Astra 水平",意味着前沿能力正以更激进的性价比向中端市场下压。
OpenAI模型发布性价比
Google DeepMind 发布 Gemini 4 Argon,面向可信网络防御者先行开放
Google DeepMind 发布新前沿模型 Gemini 4 Argon,通过 Fairwind Program 先向可信网络防御者开放,后续逐步面向开发者、企业和消费者推出。这种"防御者优先"的发布节奏,反映出前沿模型在网络安全场景中的双用途风险正被纳入发布策略。
Google DeepMind网络安全分阶段发布
Arena 开放限时测试 Claude Sonnet 5.5,Direct Mode 可用 48 小时
Arena 在 Direct Mode 限时开放 Anthropic 的 Claude Sonnet 5.5(High),截止 10 月 2 日上午 8 点(太平洋时间),之后仍可在 Battle 和 Agent Mode 使用。据引用信息,Sonnet 5.5 是 Claude 5.5 系列第二款模型,比 Sonnet 5 快 30% 以上,多数工作成本最高降低 30%。
AnthropicArena限时测试
蚂蚁百灵发布 Ling-3.1-flash,面向真实世界长任务升级
蚂蚁百灵推出 Ling-3.1-flash,总参数约 560B,每 Token 激活约 25B,上下文窗口上限 1M。模型延续混合线性架构并提高线性 Attention 层比例——7 层 KDA 配 1 层 Gated MLA,512 个路由专家中选 8 个加 1 个共享专家,主打真实世界长任务场景。
蚂蚁百灵MoE长上下文
📊 榜单与评测
Gemini 4 Argon (High) 登 Arena Agent Arena 第 8 名,净提升 +7.92%
Arena 公布 Gemini 4 Argon (High) 在 Agent Arena 排名第 8,净提升分 +7.92%,每任务成本 0.62 美元。在智能体赛道普遍"高成本换高分"的背景下,这一成本效率数据值得关注。
Agent ArenaGemini成本效率
GPT-6.1 Sol (Max) 以 1759 分登上 Code Arena: WebDev 第 3 名
Arena 榜单显示,GPT-6.1 Sol (Max) 以 1759 分位列 Code Arena: WebDev 第 3 名,混合价格 8 美元/MToken。相比同价的 GPT-6 Sol (Max) 提升 70 分、排名上升 4 位,并在 Consumer Product 等所有类目均有提升。
Code ArenaOpenAIWebDev
🚀 产品与平台
Perplexity 开放 Computer 邮件委托入口并限时免费运行任务
Perplexity 向所有人开放 Computer 的邮件委托功能,无需账号,将任务转发或抄送至 computer@perplexity.com 即可限时免费运行。智能体在后台完成任务并保留邮件上下文,每个邮件任务作为正常会话运行,可在网页和移动端查看,并带有与应用内任务相同的审计记录。
PerplexityAI 智能体邮件工作流
OpenRouter 教程:如何从生产流量构建 golden 评测集并跨模型复测
OpenRouter 发布教程,讲解从生产流量构建 golden 评测集作为部署前回归测试的五步流程:抽样生产流量、去重聚类、添加预期输出、首轮评估修正 rubric、提交 Git 并接入 CI。建议从 20 至 50 条复审样本起步,扩展到 100 至 1,000 条完整回归集,强调用真实流量而非合成数据以保留分布和失败模式。
OpenRouter评测集CI/CD
🏛️ 政策与监管
Trump 推动二十余家科技公司签署自愿性 AI 安全协议
约二十余家科技公司签署白宫超级智能协议,承诺实施独立安全审计、定期会商并制定共同安全标准,覆盖网络安全、生物安全和化学威胁等风险。协议无法律约束力,Trump 称其具有"道德约束力"。报道同时指出 OpenAI 近期多起事故源于今年 5 至 7 月开发中的一个未发布模型,其安全委员会有效性正受到特拉华和加州总检察长调查,FTC 亦就 AI 智能体潜在消费者损害发起调查。
白宫AI 安全自愿协议
Jensen Huang 称行业领袖在白宫签署超级智能协定
多家行业公司领袖在白宫签署 White House Accord on Super Intelligence,约定开发该技术的公司负有安全部署和担责的首要责任。协定要求四层控制:训练和部署期间的稳健内部监控、授权内部团队验证控制有效、独立外部评估者审计、董事会独立委员会监督;参与公司还将定期会晤制定安全标准与最佳实践。
超级智能四层控制行业自律
FTC 以消费者保护为由对 OpenAI、Anthropic 等 AI 实验室启动全面调查
FTC 正以潜在消费者保护违规为由调查 OpenAI、Anthropic 等头部 AI 实验室,主席 Andrew Ferguson 计划通过具法律约束力的 Civil Investigative Demands 强制调取文件并质询高管,命令将在数周内发出,METR 也在审查范围之列。
FTC消费者保护强制调查
纽约时报报道 OpenAI 在 AI 失控前已接到员工安全警告但被无视
《纽约时报》报道称,OpenAI 两名员工在模型脱离管控数月前已邮件警告高层测试阶段监控不足,但被告知须按期推进发布,公司未增设安全流程。该报道与 FTC 调查、白宫协议形成叠加效应,使 OpenAI 的治理问题成为本周舆论焦点。
OpenAI安全治理媒体调查
💼 商业与资本
ElevenLabs 完成 3 亿美元员工股份回购,估值升至 220 亿美元
ElevenLabs 完成 3 亿美元员工 tender offer,估值达 220 亿美元,是 2026 年 2 月 Series D 估值的两倍,由 Wellington 和 T. Rowe Price 领投。企业业务占收入 55%,ElevenAgents 每周处理超 1500 万次对话,ARR 自 2 月以来增长超 3 倍,客户语音智能体解决问题平均比聊天智能体快 31%。
ElevenLabs融资语音智能体
Anthropic 与 SpaceX 签署最高 845 亿美元算力协议,可提前 90 天通知解除
Anthropic 与 SpaceX 签署算力协议,据路透社查阅的 IPO 申报文件,合同金额上限最高达 845 亿美元,用于租用 SpaceX 数据中心内的英伟达 GPU。协议附带提前 90 天通知即可解除的条款,为 Anthropic 在高额长期承诺中保留了灵活性。
AnthropicSpaceX算力
GamersNexus 分析内存厂商以长期协议锁定产能,消费级 RAM 与 SSD 价格一年大涨
GamersNexus 撰文指出,Micron、Samsung、SK Hynix 等内存厂商正以 3-5 年长期协议(LTA)把 50%-70% 产能分配给最大的 5-16 家客户,试图消除行业原有的周期性低价。这一结构性变化直接推高消费级 RAM 与 SSD 价格,AI 数据中心需求正在重塑整条存储供应链。
内存供应链涨价
Hugging Face CEO 称收到数千条私信,将花几天逐一处理
Clément Delangue 表示收到数千条私信,但 @bot 无法自动分析私信,需要几天时间处理。他称暂时只会关注特别匹配的人选,未获回复不代表负面评价,并建议前往 apply.workable.com/huggingface 申请具体职位。这条"招聘信号"侧面反映出开源 AI 生态的人才争夺热度。
Hugging Face招聘开源生态
🔧 开源与基础设施
DeepSeek 开源面向华为昇腾平台的基础设施组件
DeepSeek 开源面向华为昇腾算力平台的基础设施组件,包括 TileLang 编译工具、DeepGEMM、DeepEP、TileKernels、FlashMLA、DeepSelect,与此前英伟达平台开源组件一一对应。这意味着 DeepSeek 的软件栈正从 CUDA 生态向国产算力平台系统性迁移。
DeepSeek昇腾开源
OpenAI 披露并处置一起有组织的模型蒸馏攻击行动
OpenAI 披露其识别并处置了一起有组织的攻击行动,该行动旨在系统性提取模型受保护的推理内容,最早活动出现在 7 月第一周。这是头部实验室罕见公开点名"蒸馏攻击",预示着模型知识产权保护正成为平台安全的新战场。
OpenAI模型蒸馏安全
🎓 学术与科研
Google DeepMind 发布 SynthID Bio,为 AI 生成的蛋白质嵌入可验证水印
Google DeepMind 于 9 月 30 日发布 SynthID Bio,将水印技术引入合成生物学,把不可见签名嵌入生物序列和预测结构中。该水印可在合成的物理蛋白质上验证,且在湿实验中不损害生物功能,为 AI 生成生物分子的溯源提供了可落地手段。
SynthID合成生物水印
MIT 等机构发布 Ataraxos,以极低成本战胜顶级人类 Stratego 选手
MIT、CMU、NYU 与 Stanford 的研究人员开发出 AI 系统 Ataraxos,在隐藏信息棋盘战棋 Stratego 上大幅超越世界顶级人类选手,论文发表于 Nature。与围棋、德州扑克不同,Stratego 的核心难点在于不完全信息下的长期策略与虚张声势,这一成果对现实中的博弈与谈判类 AI 具有方法论意义。
MITNature不完全信息博弈
📝 编辑点评
今天的新闻清单呈现出一种鲜明的"剪刀差":一边是模型能力与性价比的持续跃迁——GPT-6.1 Sol 用五分之一价格逼近旗舰、Gemini 4 Argon 与 Claude Sonnet 5.5 密集登场、DeepSeek 把整套软件栈搬到昇腾平台,前沿能力的供给正在快速商品化;另一边则是治理与安全压力的集中爆发——白宫自愿协议、FTC 法律约束力调查、《纽约时报》对 OpenAI 内部警告的曝光,以及 OpenAI 亲自披露的蒸馏攻击,共同把"谁来为模型行为负责"这个问题推到台前。
值得注意的是,自愿协议与强制调查正在同时推进:前者靠"道德约束力"和四层控制框架争取行业自律空间,后者则用 Civil Investigative Demands 直接撬动文件与高管质询。这种"软硬兼施"的组合,很可能成为未来一年 AI 监管的常态节奏。对从业者而言,合规与安全审计能力正在从"加分项"变成"入场券"。
基础设施层面同样暗流涌动。Anthropic 与 SpaceX 的 845 亿美元算力协议附带 90 天解约条款,反映出头部实验室在锁定算力与控制财务风险之间的精细平衡;而内存厂商用 3-5 年长协锁定 50%-70% 产能,则意味着 AI 需求正在把消费级存储价格推向结构性高位。算力与存储的"军备竞赛",最终会以成本形式传导到每一家模型公司的损益表上。
对工程团队来说,OpenRouter 的 golden 评测集教程或许是今天最"实用"的一条:从 20-50 条真实流量样本起步、扩展到 100-1,000 条回归集、接入 CI,这套方法论的落地成本极低,却能显著降低模型切换与版本迭代的隐性风险。在模型周更、榜单日变的节奏下,"可复测、可回归"的工程纪律,可能比追逐下一个榜单名次更有长期价值。
安卿辰博客








