每日 AI 资讯速递
今日AI领域迎来密集发布:MiniMax H3、Qwen3.8-Max等重量级开源模型相继亮相,欧盟AI透明度法规正式生效,OpenAI、Claude Code等产品更新不断。从模型架构到智能体框架,行业正加速向全模态、低成本、可治理的方向演进。
🚀 大模型
MiniMax H3 正式开源:通用全模态生成系统支持 2K 视频与原生立体声
MiniMax 正式开源新一代通用视频模型 H3,可统一理解文本、图像、视频和音频,生成最高 2K 分辨率、最长 15 秒、带 32 kHz 原生立体声音频的视频。实测覆盖广告TVC、短剧、创意片头、动态海报、UI动效和游戏实机六类场景,一次最多放9张图、3段视频和3段音频,提示语最高支持7000字符。
开源模型视频生成全模态
Qwen3.8-Max 发布:开源最强编码与协作模型,2.4T 参数
Qwen 正式发布 Qwen3.8-Max,这是 Qwen 家族迄今最强的模型,拥有 2.4T 参数(95B 激活),并首次开源 Qwen-Max 级权重,开放权重将于下周发布。这一举措标志着顶级模型的开源进程进一步加速,为开发者提供了前所未有的自主部署能力。
开源模型编码2.4T参数
商汤发布 SenseNova U1.5-Lite-Preview 开源模型
商汤推出 SenseNova U1.5-Lite-Preview,一个基于 NEO-Unify 架构的轻量级原生统一多模态模型,仅 8B-MoT 参数即可达到商业闭源模型的生成与编辑质量。这一突破表明小参数模型通过架构创新也能实现高性能,为端侧AI部署提供了新选择。
多模态轻量级8B-MoT
OpenAI 新模型 Astra 数学表现出色,但被过度吹捧
OpenAI 内部测试的新模型 Astra 在数学问题上表现惊艳,但 Gary Marcus 指出相关讨论犯了"合成谬误":擅长某类数学不等于擅长所有数学、科学乃至一切认知任务。数学之所以成为突破口,是因为它便于用符号工具验证且能廉价生成海量合成数据,而开放世界问题无法如此模拟。
数学推理行业争议
⚡ 产品发布
GPT-Live实时音频新架构发布
GPT-Live 是一种用于实时音频的新架构和栈,可以在说话的同时聆听。为了让这种体验在 ChatGPT 规模下显得自然,团队从客户端到模型重建了语音栈,让音频持续流动,更深入的推理和工具使用不会打断对话。
实时音频语音交互
Grok 支持分析任意视频
Grok 现在可以分析任何视频,用户只需分享链接即可获得深度解析。这一功能拓展了Grok的应用场景,从文本对话延伸到视频理解领域,为用户提供更全面的信息处理能力。
视频分析多模态
Kimi Work 幻灯片制作教程发布
Kimi Slides 处理整个幻灯片制作流程:由 Kimi K3 驱动的清晰结构研究、连贯设计(包括精美图表和 SmartArts),可编辑并直接下载。这标志着AI办公工具在垂直场景的深度优化。
办公效率幻灯片
Claude Code 连接器可复用至 Artifacts
Claude Code 现在可以复用连接器(如 Gmail、日历、Slack 等),包括在 Artifacts 中。这一集成让开发者能够更高效地在编码环境中访问外部数据和服务,提升工作流自动化程度。
集成开发者工具
🔧 开源项目
微软开源 Orchard 智能体训练框架
Orchard 是一个面向研究社区的开源框架,用于跨任务类型训练和评估 AI 智能体。它降低了复杂性,同时通过让研究人员复用同一套基础设施,支持较小模型也能实现强劲性能。
智能体训练框架
AirLLM 实现单块 4GB GPU 运行 70B 模型推理
AirLLM 项目支持在单块 4GB 显存 GPU 上运行 70B 参数大模型推理,无需多卡或大规模显存配置。该项目已开源,相关讨论在 Hacker News 上获得 103 点热度,引发社区关注。
推理优化低显存
OpenRouter 推出 Ori Eval 简化评估流程
OpenRouter 推出 Ori Eval,利用其 API 处理代码库中的每项任务并评估结果,让开发者以最简单的方式编写首个评估。这解决了"没有绝对最好的模型,只有最适合每项任务的模型"的痛点。
评估工具API
Cloudflare 推出 @cloudflare/computer 预览版:为智能体提供虚拟文件系统与多执行环境
Cloudflare 发布 @cloudflare/computer 早期预览版,这是一个开源智能体运行时,为每个智能体提供虚拟文件系统,并支持在 isolate、容器沙箱或浏览器中执行代码。这一设计为智能体开发提供了灵活、安全的执行环境。
智能体运行时云原生
📋 行业动态
Palantir CEO Alex Karp 称 AI 行业"马克思主义"
Palantir CEO Alex Karp 在季度股东信中警告,前沿 AI 实验室对企业过于不可信,并称其意图"占有所谓合作伙伴的生产资料",带有"马克思主义色彩"。该公司第二季度营收 19 亿美元,同比增长 93%,利润 11 亿美元,主张提供模型无关的 AI 与分析软件。
行业观点财报
EA 首席战略官谈生成式 AI 如何进入可游玩的实时游戏世界
EA 首席战略官 Mihir Vaidya 认为,游戏是 AI 的试验场,但生成式 AI 进入游戏面临 60 帧/秒、数千玩家同步和低延迟等严苛约束,不能只追求"看起来真实",而必须"行为正确"。EA 将 AI 影响分为效率、扩展和转型三个层面,《模拟人生》已服务超 5 亿玩家。
游戏AI神经符号架构
Google Agent Skills 幕后:如何构建、测试与规模化
Google Agent Skills 团队详解其开源技能库的构建与治理流程:项目始于 Google Cloud Next 2026 前的"swarm"冲刺,发布后 GitHub 星标超 15,000。为保证规模化下的质量,每个技能须通过标准化目录结构、CI/CD 流水线及持续评估。
智能体技能CI/CD
Codex 用 Sol 指挥 Luna Max 省额度翻倍产出
Codex 高阶玩法:让 Sol 在 `~/.codex/agents/` 下创建 `luna-worker.toml` 子代理,模型设 `gpt-5.6-luna`、reasoning effort 设 max,Sol 负责拆任务与审代码,具体实现自动委托给 Luna Max。这一模式展示了多智能体协作提升效率的潜力。
多智能体效率优化
🏛️ 政策法规
欧盟《人工智能法案》透明度规则生效,违规最高罚 1500 万欧元
欧盟《人工智能法案》下的新透明度义务于 8 月 2 日生效,要求公司披露用户何时与 AI 模型互动,并为合成音视频和文本添加机器可读标记。违规公司面临最高 1500 万欧元(约 1720 万美元)或全球年营业额 3% 的罚款,8 月 2 日前推出的模型有 4 个月宽限期。
AI监管透明度欧盟
🌐 基础设施
Cloudflare 推出 Billable Usage API:为自助账户提供按产品与计费周期的程序化成本可见性
Cloudflare 发布 Billable Usage API,为自助账户提供单一端点,一次调用即可返回按产品和计费周期拆分的用量与成本,覆盖 Workers、R2、D1、Workers AI、Vectorize、Images 和 Stream。这一工具帮助企业更好地管理和优化云成本。
成本管理API
Cloudflare Workers 与 Containers 现已支持入站 TCP 连接和 gRPC
Cloudflare 在 Agents Week 期间推出 Workers 运行时新处理器 connect(socket),可直接接受 Spectrum 提供的入站 TCP 套接字,并支持将套接字转发至 Durable Objects 或 Containers,实现全双工通信。这为边缘计算场景提供了更强大的网络能力。
边缘计算TCP/gRPC
📝 编辑点评
今日热点呈现三大趋势:其一,开源模型迎来"重量级"爆发——MiniMax H3、Qwen3.8-Max(2.4T参数)、商汤SenseNova U1.5-Lite-Preview相继登场,开源与闭源模型的性能差距正在快速缩小,企业级用户获得更多自主可控的选择。其二,智能体基础设施加速成熟——微软Orchard、Cloudflare @cloudflare/computer、Google Agent Skills等框架和工具密集发布,标志着AI智能体从概念验证走向工程化、规模化部署阶段。其三,监管与商业化的博弈进入深水区——欧盟AI法案透明度条款正式生效,而Palantir CEO对大型AI实验室的"马克思主义"批评,折射出企业对数据主权和控制权的深层焦虑。值得注意的是,AirLLM在4GB GPU上运行70B模型、8B-MoT参数达到闭源质量等突破,正在打破"大模型必须大算力"的固有认知,边缘部署和端侧AI的想象空间被进一步打开。可以预见,未来一段时间的竞争焦点将从"模型能力"转向"工程效率"和"治理能力"。
安卿辰博客








