封面:NVIDIA 放开 34B 自动驾驶大模型商用|木杉AI科技日报8 月 5 日的五条消息,指向同一个更务实的问题:模型能力如何真正进入生产流程。阿里把图像能力做成云端产品档位,Google Cloud 把数据库上线和运维拆给两个智能体,FLUX 3 Video 给创作者提供了带声音的连续视频生成;NVIDIA 则为自动驾驶团队放开了可商用的大模型权重。研究侧的 Video-DeepResearch 进一步把“查资料”推进到需要逐帧看视频、再联网核实的任务。
1. 模型发布/更新:Qwen-Image-3.0-Pro 与 Standard 上线 Qwen Cloud
阿里通义千问宣布 Qwen-Image-3.0-Pro 与 Qwen-Image-3.0-Standard 已在 Qwen Cloud 上线。对需要做营销图、社媒配图、商品素材和概念稿的团队而言,这次变化的重点不只是多了两个名字,而是把图像生成按效果与成本拆成了更明确的服务档位:对画面细节和成片质量要求高的任务可以选择 Pro,量大、需要更快试错的工作流则可以先用 Standard。
这会减少“为了一张图临时换工具、重新配账号和工作流”的摩擦。使用者可以在同一个 Qwen 云端入口里做不同预算的迭代,再把更高规格的调用留给最终成片。官方公开入口展示的是云端服务;具体可用地区、套餐、配额和计费仍应以登录后的 Qwen Cloud 页面为准。
Qwen Cloud 官方入口页面来源:Qwen Cloud 官方入口
2. 产品发布/更新:Google Cloud 把数据库的 Day 0 和 Day 1/2 交给智能体
Google Cloud 在 Agentic Data Cloud 的发布中给数据库团队配了两位新同事。Database Onboarding Agent 面向 Day 0:根据业务需求推荐合适的 Google Cloud 数据库,并引导完成配置和部署。Database Observability Agent 面向 Day 1/2:跨 AlloyDB、Bigtable、Cloud SQL 和 Spanner 持续观察性能与健康状态,定位潜在问题的根因,并给出排障建议。
这两个智能体解决的是数据库团队最琐碎、也最怕出错的两段工作。前者把选型和初始配置从“翻文档、比参数”变成可追问的引导;后者把报警后的多系统排查缩短为先给出关联信号与修复方向。它们目前均为 Preview,生产团队仍需按自己的变更审批、权限和回滚流程验证建议,不能把自动建议直接等同于自动上线。
Google Cloud Agentic Data Cloud 官方发布配图来源:Google Cloud 官方博客
3. AI 行业动态:FLUX 3 Video 进入 OpenRouter
Black Forest Labs 的 FLUX 3 Video 已通过 OpenRouter 面向所有人开放。它不是只把静态图“动起来”的工具:官方介绍支持文本生成视频、图像到视频、首尾帧或多关键帧控制、至多四秒的音视频续写,以及与画面一起生成对白、环境声和音效。对短片、产品演示和广告团队而言,关键帧和续写意味着先确定构图与角色,再补接镜头,不必每次从一段全新的提示词开始抽卡。
OpenRouter 的意义在于,开发者可以沿用统一的模型调用、鉴权和用量管理方式接入,而不是单独维护一套供应商集成。BFL 同时说明,FLUX 3 Video 也可经其 API 与指定合作伙伴使用;实际价格、速率限制和可用模型版本,应以 OpenRouter 的实时模型页为准。
FLUX 3 Video 官方发布配图来源:Black Forest Labs 官方发布、OpenRouter 官方公告
4. 模型发布/更新:NVIDIA Alpamayo 2 Super 开放商用
NVIDIA 发布 Alpamayo 2 Super:一款为 Robotaxi 与自动驾驶研发设计的 34B 参数视觉-语言-动作模型。它由 32B 视觉语言主干与 2B 扩散专家组成,可覆盖轨迹预测、视觉问答、二维目标定位和自动标注等任务,目标是把感知、规划与决策相关工作收束到一套基础模型上。模型卡特别强调了复杂路口、加塞、行人互动和恶劣天气等安全关键长尾场景。
最重要的变化是发布即能商用。权重采用 Linux Foundation 的 OpenMDW-1.1 许可,可用于微调、衍生模型和商业再分发;源代码是 Apache 2.0。对车企、Robotaxi 公司和供应商来说,这意味着可以用自有道路数据与驾驶策略适配模型,并把经验证的版本推入自己的开发链路,而无需额外申请模型商用许可。开源许可不替代道路安全验证、数据合规或地区监管要求,实际部署仍须经过完整的仿真和车端验证。
NVIDIA Alpamayo 2 Super 官方发布配图来源:NVIDIA 官方博客、官方模型卡
5. 论文研究:Video-DeepResearch 让智能体先看懂视频,再上网找证据
论文《Video-DeepResearch: Towards the Next-Generation Multimodal Deepresearch Agent》把深度研究智能体从静态图片扩展到连续视频流。作者观察到,现有模型经常绕过视觉工具、偏向文字搜索,或直接依赖参数记忆回答。为此,Video-DR 把感知和探索解耦,并按阶段开放工具:先要求智能体跨帧定位和理解视频证据,再进入网页检索与交叉核实。
这对需要复盘长视频、核查事件片段、从教程或直播中找细节的研究任务很关键。作者还发布了含 200 道复杂多跳视频问答的 Video-DR-Bench;论文报告其 35B-A3B 模型平均准确率为 64.0%。这一成绩来自论文自建评测与作者对比,适合作为研究结果而非通用生产保证;代码已在论文页链接的 GitHub 仓库公开。
Video-DeepResearch 论文首页来源:arXiv 论文页、Vision-DeepResearch 代码仓库