尧图网站设计 尧图网站设计YAOTU DESIGN
ARTICLE DETAIL

资讯详情

深耕网站设计与一线实操的经验洞察。

阿里ATH事业群技术副总裁郑波:全模态AI的最新进展与未来预判

阿里ATH事业群技术副总裁郑波:全模态AI的最新进展与未来预判 在2026云栖大会上阿里巴巴 ATH 事业群技术副总裁、淘天集团首席科学家郑波拆解了当下多模态生成 AI 的行业变革趋势同时公开了阿里巴巴全模态生成模型的最新迭代成果与未来技术蓝图。阿里巴巴 ATH 事业群技术副总裁、淘天集团首席科学家郑波从图像、音乐、虚拟世界到智能视频创作阿里 AI 正在打破各类模态壁垒朝着统一全模态生成模型全速进化将改写内容创作行业的底层逻辑。01 多模态 AI 质变从生成内容到创造沉浸式体验当下的多模态生成领域正在发生三大核心变革AI 早已跳出单一内容生成的局限迈入全新发展阶段。首先文本、图像、视频、声音、空间能力加速协同融合行业正式告别单模态单点能力进入多模态一体化发展时代。其次AI 不再只是机械生成内容而是能够读懂人类创作意图打造完整沉浸式视听交互体验完成了从浅层内容生成到深层体验塑造的跨越。最后多模态 AI 走出实验室深度落地广告、影视、游戏、电商等实景场景成为全网内容生产的全新基建。如今 AI 生成内容的真实度已经达到人类难以分辨的水准。ACM 通信研究数据显示人类识别 AI 生成内容的平均准确率仅为 51.2%识别概率基本等同于抛硬币。技术迭代的同时市场规模也在爆发式增长。数据显示63% 的视频营销人员已常态化使用 AI 视频工具预计 2030 年AI 图像、视频生成市场规模将达到608 亿美元。郑波表示传统内容创作链路冗长从想法到落地存在极高门槛。而全模态生成 AI 的核心价值就是大幅降低想象落地成本让创意直接转化为可看、可听、可交互的体验未来体验供给将呈指数级增长边际成本无限趋近于零。02 阿里巴巴全模态生成模型迭代覆盖图像、音乐、虚拟世界、视频全场景经过多年布局阿里已搭建起完整的全模态生产体系拥有 Qwen‑Image图像生成、Wan/Happy Horse视频生成、Happy Shrimp音乐生成、Happy Oyster世界模型 等多款核心模型覆盖不同创作场景与用户需求。在本次云栖大会上多款模型迎来重磅升级。Qwen‑Image 3.1可直接商用的生产力级图像生成工具全新升级的 Qwen‑Image 3.1主打生产力落地生成内容不仅画面精美更具备精准的信息理解、排版设计与专业认知能力成品可直接上线交付。郑波重点讲解了Qwen‑Image 3.1在商业、创意、学术、消费四个典型场景的应用能力。例如服饰海报这款模型能够精准复刻、批量生成统一风格套图还能根据剧情自动生成含画面、对白、镜头语言的电影分镜脚本。针对学术原理示意图、主题海报、长图文排版等专业场景模型也能精准理解核心逻辑实现高密度信息的分层排版重点清晰、观感专业。除基础生成能力外模型的智能编辑与空间推理能力大幅提升。支持图片风格改写、元素替换、3D 多角度造型生成还能基于单张图片推演周边环境生成可 360 度观看的全景沉浸式画面。Happy Shrimp 1.1零基础也能创作专业歌曲继 7 月推出初代音乐模型后阿里正式发布 Happy Shrimp 1.1 版本实现了音乐创作能力的全方位升级。新版本支持百余种曲风、十余种流行音乐风格可独立完成人声歌曲、纯音乐的全流程创作相比 1.0 版本有四大核心突破旋律记忆点更强音乐性与稳定性显著提升人声表现更鲜活唱法多元情绪表达精准可控深度理解创作意图复杂指令遵循度大幅优化多语言演唱发音清晰改善错字、含混问题。这款模型实现了普惠与专业双向适配。对专业创作者而言它是可精细化调控的工业级音乐生产工具对普通用户来说无需乐理、无需乐器一句话就能将创意变成完整歌曲。Happy Oyster 2.0 Preview逼近真实的实时交互虚拟世界AI 的核心进化方向不止是内容生成更是理解世界、交互世界。本次亮相的 Happy Oyster 2.0 Preview 版本让 AI 虚拟世界的真实度、稳定性、交互性实现跨越式升级。首先是物理规则写实化虚拟场景中的物体运动轨迹、碰撞、飞溅效果完全贴合现实物理规律告别 “虚假仿真”。其次是世界记忆更稳定依托 3D 增强型时空记忆技术模型可将场景、物体、运动轨迹统一映射至三维空间即便切换镜头、视角场景位置、形态也不会错乱。最后是交互实时化通过 AI 扩散模型与策略训练方案优化用户操作后的虚拟世界反馈更快、延迟更低无限逼近真实实时交互体验。同时阿里联合北大、南大等高校搭建世界模型评估标准体系为行业发展统一评判尺度。03 视频 AI 迈入新时代从素材生成到自主智能创作作为多模态赛道竞争最激烈的领域视频生成 AI 在半年内完成了多轮迭代郑波清晰梳理了行业演进路径。行业早期处于基础验证阶段核心目标是解决视频生成的画质、流畅度问题今年上半年行业迈入多模态生成阶段模型可融合文字、图片、音视频多维度信息创作这也是目前主流用户的核心使用场景。而当下视频 AI 正在迈入全新的智能化创作阶段。全新的智能化视频生成模型不再是简单拼接素材片段而是具备完整的创作思维能够读懂核心创作目标理解故事叙事逻辑与镜头语言可自动拆解剧情、设计分镜、搭配角色场景完成全流程视频创作。郑波表示阿里视频生成模型将持续朝着时长更长、结果更可控、叙事更完整、创作更智能四大方向进化长时间内容保持画面一致性、精准掌控全量创作元素、完整还原剧情情绪、深度匹配用户创作意图打造具备 “导演思维” 的 AI 模型。他正式预告阿里全新升级的视频大模型将于今年 11 月正式上线进一步解锁 AI 智能创作的全新能力边界。04 预判3 年内全模态统一 AI 模型将诞生郑波给出了自己对 AI 行业未来的判断当下所有细分模态模型都只是阶段性过渡产品。未来三年内行业将诞生原生全模态统一生成模型。这并非图像、视频、音乐等多类模型的简单功能拼接而是单一模型原生具备全维度能力可统一完成内容生成、世界理解、场景交互。届时AI 创作将打破模态壁垒技术规模化落地难度大幅降低。行业也将完成从 “生成内容” 到 “理解世界”、从 “分散模型” 到 “统一架构”、从 “单一内容” 到 “全域体验” 的终极蜕变。
返回列表