AI 日报 · 2026-08-05
今天的 AI 动态集中在几个清晰的方向:多模态与统一模型成为主流叙事,多家厂商发布可同时处理文本、图像、视频、音频的模型;本地推理与开源工具链持续进化,在 Mac 上跑 80B 模型、在 4GB 显存微调 8B 模型成为现实;行业层面,工信部发布首部 L3/L4 自动驾驶强制性国标,为高阶自动驾驶的量产落地提供了法规依据。
以下是今日 29 条动态中的精华整理。
一、模型发布与更新
1. NVIDIA Alpamayo 2 Super 开放商用
NVIDIA 宣布 Alpamayo 2 Super 正式开放商用。该模型面向 Robotaxi 与自动驾驶场景,基于 Cosmos 3 Super Reasoner 构建,支持轨迹预测、因果链推理、元动作(meta-actions)、自动标注及视觉问答。这是 NVIDIA 在自动驾驶基础模型领域的重要布局,将开源模型的战场从通用对话拉向了物理世界理解。
官方博客:https://blogs.nvidia.com/blog/alpamayo-2-super-open-model-now-available
2. 商汤 SenseNova U1:统一推理与图像生成
商汤发布 SenseNova U1 并开源。该模型可在统一流程中同时进行推理与图像生成——「信息图模式」可将单条提示词转为结构化幻灯片,「交错模式」则逐步生成图文内容。已上线 SenseNova Studio、HuggingFace 及 GitHub。这标志着国产大模型在多模态统一架构探索上的重要一步。
3. FLUX 3 Video:统一视频、音频、图像与动作预测
Black Forest Labs 的 FLUX 3 Video 通过 OpenRouter 开放。这是一个基于统一架构联合训练的多模态模型家族,覆盖视频、音频、图像和动作预测。值得注意的是,Black Forest Labs 同步发布了技术博客详细说明生成部分的实现。
4. 蚂蚁百灵 Ling-3.0-flash 开源权重
蚂蚁百灵发布 Ling-3.0-flash 的开源权重,官方 BF16 和 FP8 量化版本同步上线。这为不同硬件条件与部署需求的开发者提供了灵活选择,是开源社区的又一友好举动。
5. 腾讯混元 Hy ASR 3.0 preview:真正懂上下文的语音识别
腾讯混元发布 Hy ASR 3.0 preview,中文普通话 WER 3.34%、英语 2.62%、粤语 3.12%。核心亮点在于「上下文纠错」能力——大模型语义理解被引入 ASR 后处理,支持热词注入和高噪耳语场景。已上线腾讯云 API,元宝 App 首发免费开放。这是语音识别从「音转字」迈向「语义理解」的典型示例。
二、产品与开源工具
6. Swiftlet:在 Mac 上跑 80B Qwen,内存仅 4.3 GB
Swiftlet 是一个基于 Swift + Metal 的运行时,可在 Mac 上运行 80B 版本的 Qwen,内存占用仅 4.3 GB;在 iPhone 上可运行 35B 版本。其核心技巧是将混合模型的专家权重按需从存储流式加载,实现极低的内存占用。这为 Apple Silicon 设备上的本地大模型推理提供了新思路。
7. Soup v0.72.4:4GB 显存微调 8B 模型
Soup 发布 v0.72.4,支持在 4GB 显存的笔记本 GPU 上通过 QLoRA 微调 8B 模型,全程无需 SSH 或云服务。这让个人开发者在本机完成模型微调成为可能,降低了入门门槛。
8. SpecForge v0.3.0:统一投机解码栈
LMSYS 发布 SpecForge v0.3.0,统一了多种投机解码(speculative decoding)算法,支持 EAGLE3、EAGLE3.1、P-EAGLE、DFlash、Domino、DSpark 等。对于需要在生产环境中优化推理吞吐的团队来说,这是一个值得关注的基础设施工具。
9. Reflex 开源 XY:Rust 加持的超快 Python 绘图库
Reflex 开源了基于 Rust 的 Python 绘图库 XY,Apache-2.0 许可。在 1 万到 1 亿点范围内保持约 0.08 秒的渲染时间。对于数据可视化和交互式分析场景,这样的性能可以获得显著的体验提升。
10. 面壁智能开源 ForgeStencil:自动优化工业软件
面壁智能开源了 ForgeStencil,宣称是全球首个支持 Stencil 自动研究、自动部署的 AI 优化系统。Kernel Agent 与 App Agent 闭环协作,可在约一周内自动优化 100+ 工业与科学软件,全程零人工介入。这将 AI 在编译器与高性能计算领域的应用向前推进了一步。
三、行业动态
11. 工信部发布首部 L3/L4 自动驾驶强制性国标
工信部发布我国首部针对 L3/L4 高度自动驾驶系统的强制性国标(GB 44721—2026),将于 2027 年 7 月正式实施。这标志着中国高阶自动驾驶从「鼓励探索」走向「有法可依」,对车企、供应商和出行服务商都将产生深远影响。
12. Anthropic 与 Volta 签署 100 亿美元算力协议
Anthropic 与云初创公司 Volta 签署了 100 亿美元的算力协议。值得注意的是,成立仅数月的 Volta 估值 24 亿美元,且硬件几乎全为租用。Anthropic 换取的是交付速度,但同时也承担前所未有的交易对手风险。AI 算力供应链的紧张程度可见一斑。
13. GPT-5.6 Luna 降价 80% 永久生效
OpenAI 的 GPT-5.6 Luna 宣布降价 80%,且永久生效。在算力依然供不应求的大背景下,这一降价策略或意在扩大生态、抢占市场份额。与之对应的是 Anthropic Fable 5 定价每百万输出 token 50 美元——两种截然不同的商业策略,值得持续观察。
14. 更多值得关注的动态
- OpenAI 公布第三方网络安全评估事件说明及新保障措施:透明度与安全边界之间的博弈仍在持续。
- AI 领袖提出 SAFE 指南:强化智能体网络安全透明度,NVIDIA Blog 专栏。
- Google 发布 Gemini 3.6 Flash 等三款新模型,并更新 Gemini Robotics ER 2。
- Cuéllar 加入 Anthropic 出任首席全球事务官:前卡内基国际和平基金会主席、加州最高法院法官,履历分量十足。
四、技巧与观点精选
15. 单颗 AMD MI300X 跑 DeepSeek V4 Flash
社区成员分享在单颗 MI300X(192 GB HBM)上运行 DeepSeek V4 Flash(304B 参数)的实践:单流解码 168.6 tok/s,8 并发流聚合吞吐 542 tok/s,并验证了 256K 上下文。这对 AMD 生态的推理性能验证极具参考价值。
16. MiniMax-H3 通过 MLX 移植到 Apple Silicon
Simon Willison 分享了 MiniMax-H3(全模态生成系统)通过 MLX 移植到 Apple Silicon 的体验,在 M5 Max 上视频生成耗时不到 45 分钟。本地多模态生成迈出了重要一步。
17. 从零开始用 Codex 做硬件
公众号「数字生命卡兹克」分享了一个有趣而励志的实操:零基础 5 天,用 Codex 从零搓出一个能提醒久坐的猫爪硬件。这个案例生动展示了 AI 编程助手如何将硬件入门门槛降到极低。
18. 杰文斯悖论与 AI 定价分层
Tomer Tunguz 在博客中提出一个尖锐问题:科技巨头算力仍然供不应求,但 AI 定价却在分化——Anthropic 高定价、OpenAI 大降价。杰文斯悖论(效率提升反而增加总需求)还能否持续,取决于定价策略与算力扩张之间的博弈。
今日要点总结
- 多模态统一模型成为共识:商汤 U1、FLUX 3 Video、MiniMax-H3 均采用统一架构处理多种模态,这正在成为新一代大模型的标配方向。
- 本地推理门槛持续下降:Swiftlet 在 Mac 上跑 80B 模型、Soup 在 4GB 显存微调 8B 模型,个人开发者的硬件体验正在被改写。
- 自动驾驶进入法规深水区:首部 L3/L4 强制性国标发布,行业将从拼 Demo 进入拼合规、拼安全验证的新阶段。
- 推理优化工具链走向成熟:SpecForge 统一投机解码、MI300X 跑 DeepSeek V4 的实践,说明推理性能优化已成为核心竞争力。
数据来源:AI HOT 日报(aihot.virxact.com),共 29 条动态。