尧图网站设计 尧图网站设计YAOTU DESIGN
ARTICLE DETAIL

资讯详情

深耕网站设计与一线实操的经验洞察。

从DiT到Agent:腾讯研究院50个AI关键词背后的技术趋势解析

从DiT到Agent:腾讯研究院50个AI关键词背后的技术趋势解析 简介《AI图景解码50个年度关键词》是腾讯研究院2025年发布的系统盘点AI领域年度关键技术趋势的报告面向大学生、企业人员、互联网从业者及行业关注者。报告精选50个关键词覆盖图像处理、视频生成、3D生成、编程助手、Agent、端侧智能、具身智能与基础模型八大领域创新性采用快思考与慢思考双维度构建50张AI技术图景卡片帮助读者系统性降低信息获取成本。资源为单份PDF文档大小约8.1MB内容包含DiT架构演进、图像生成控制、高分辨率图像处理、AI图像商业化及医疗AI等核心观察每张卡片附有技术定义、逻辑链条、本质洞见与趋势判断可直接作为研究与决策参考。已有729人学习下载适合用于技术研究、行业趋势研判、教学讲座素材及个人知识体系更新。1. 腾讯研究院这份 AI 年度报告为什么值得逐页拆着读2025 年开年AI 领域的信息密度已经到了单靠“刷推送”跟不上的程度图像生成的底层架构刚换成 DiT视频生成又卷向世界模拟器3D 生成和高斯泼溅在游戏与影视行业悄悄落地端侧智能和 Agent 则在重新定义“AI 应该跑在哪里”。腾讯研究院这份《AI图景解码 50 个年度关键词》正是冲着这个信息过载问题来的——它没有停留在“某某模型发布了”的新闻层而是把过去一年积累的三十余万字 AI 进展数据库压缩成 50 张技术图景卡片每张卡片都按“快思考”印象卡片技术定义、图示、总结语和“慢思考”逻辑链条、本质洞见、趋势判断两个维度展开。对大学生做报告、企业人员做技术选型、互联网从业者追踪方向来说它更像一份带索引的年度技术地图而不是一本读完就忘的行业白皮书。下面我按报告里最值得展开的几条主线——从 DiT 架构到图像控制、再到视频生成与端云协同——把它拆开讲并给出可以直接复现的验证路径。2. DiT 架构图像生成从 U-Net 到序列建模的范式切换2.1 为什么说 DiT 是报告里最值得先读懂的关键词报告在“核心观察”里反复出现一个判断图像生成正在从传统扩散模型走向序列化建模Transformer 在不同模态之间的底层范式可以实现迁移。这句话对应的是 DiTDiffusion Transformer架构——把扩散模型的去噪过程与 Transformer 的序列建模能力合到一起。此前主流的 Stable Diffusion 系列用的是 U-Net 作为去噪骨干网络U-Net 擅长处理局部特征但面对长距离依赖、复杂空间关系时表达能力有瓶颈DiT 则把图像切块成 token用 Transformer 的注意力机制去建模这些 token 之间的关系。项目正文里列出的逻辑链条很简洁ATransformer 从文本扩展到图像→ BDiT 带来图像生成质的飞跃→ CScaling Law 在图像领域开始生效。这三步对应三个可以直接观察到的工程事实SD3、Flux、混元文生图等新一代模型都把骨干换成了 MMDiT 这类 DiT 变体模型参数规模从早期的 800M 一路涨到 12B 量级生成质量随参数量和数据量提升的曲线开始出现类似大语言模型那种“能力涌现”——细节还原、复杂提示跟随、空间关系理解都明显跳变。2.2 从“下一个 token”到“下一个像素”的迁移逻辑要理解 DiT 为什么能迁移关键看它怎么处理图像。传统扩散模型的前向过程是逐步加噪逆向过程是逐步去噪U-Net 在这个过程里充当噪声预测器。DiT 的做法是把加噪后的图像切成 patch映射成 token 序列送入 Transformer 块做注意力计算最后把输出重新排列成噪声预测图。这套流程里Transformer 的序列建模能力被直接复用到像素空间——就像语言模型预测下一个 token 一样DiT 在预测“下一个去噪步的像素状态”。序列建模能力的迁移意味着 NLP 领域积累的 Scaling 经验、训练技巧、分布式并行方案都可以平移到图像生成上。我在本地复现过 SD3 的推理流程用 diffusers 库加载模型做文生图可以直观看到 DiT 架构下 UNet 被替换成了 Transformer 结构from diffusers import StableDiffusion3Pipeline import torch pipe StableDiffusion3Pipeline.from_pretrained( stabilityai/stable-diffusion-3-medium, torch_dtypetorch.float16 ).to(cuda) prompt a professional photograph of a mountain lake at sunrise, highly detailed image pipe( promptprompt, negative_promptlow quality, blurry, num_inference_steps40, guidance_scale5.0, height1024, width1024, max_sequence_length256 ).images[0] image.save(dit_sample.png)参数说明num_inference_steps控制去噪步数DiT 架构下 40 步已经能出不错的效果比 SD1.5/2.1 时期常用的 50 步更省算力guidance_scale是提示词遵循强度5.0 是平衡点调太高会过曝、颜色失真max_sequence_length是文本编码器的最大序列长度SD3 使用 T5 文本编码器把这个值调高能提升复杂提示的理解能力。提示DiT 模型对显存要求偏高12B 量级的完整模型在单张 24G 显存卡上跑推理需要开启enable_model_cpu_offload()否则会显存溢出。工程上推荐先跑 2B 或 3B 量级的 DiT 变体验证效果再决定要不要上更大模型。2.3 Scaling Law 在图像领域的工程含义报告提到“图像领域正在复制语言模型的缩放法则与能力涌现”这句话不是修辞而是有明确工程指向的。语言模型的 Scaling Law 说的是损失随参数量、数据量、算力呈幂律下降DiT 论文 Scaling Diffusion Transformers 也给出了类似结论——在 ImageNet 生成任务上增大模型参数量和训练步数FIDFréchet Inception Distance评估生成图像与真实图像分布差距的指标稳定下降。换句话说图像生成的能力上限主要由“参数量 数据量 算力”决定架构创新是放大器。这个判断对从业者的影响是如果团队打算自研图像生成模型拼架构创新的空间已经不大真正的护城河在数据质量和算力规模。如果团队只是做应用层那关注点应该放在如何用好开源 DiT 模型、如何在具体场景里做微调或接入控制条件而不是重复造轮子。报告里“图像生成控制”那部分观察正好把这条路讲清楚了。3. 图像生成控制从 Prompt 语义描述到多层次精确干预3.1 控制力为什么是 2025 年图像生成的主线报告在“图像生成控制”卡片里总结了一条演进路径描述控制Prompt→ 参数控制LoRA 微调→ 条件控制ControlNet→ 工作流控制外部编排。这条路径的内核是生成结果要从“碰运气”变成“可预期”。早期文生图模型的 Prompt 控制能力很弱写再多形容词也只是影响风格和构图的大方向很难精确到“这个人的左边脸有阴影”“这条桌子的透视必须这样”。LoRA 解决的是“风格和主体一致性”问题用少量数据低成本微调模型ControlNet 解决的是“结构控制”问题通过额外输入深度图、Canny 边缘、姿态骨骼、法线图给生成过程强约束。报告里的核心观察说得很到位控制正从“描述性”向“操作性”演进图像生成正在从粗放生成走向精确控制。这意味着什么在生产环境里设计师要的不是“再来一次看看效果”而是“把构图固定住只改色调”或者“保持人物姿态不变换一套服装”。ControlNet 和 IC-Light、Paints-Undo 这类工具解决的就是这类操作性需求。3.2 多层次控制组合一份可复用的工作流参数表我在实际项目中习惯把 ControlNet 和 LoRA 组合使用先用 ControlNet 锁结构再用 LoRA 定风格最后用 Prompt 描述细节。下面是一套在 ComfyUI 里可执行的组合工作流参数配置适合电商产品图、角色立绘等对构图一致性要求较高的场景模块推荐模型/参数作用关键参数基础模型SDXL / SD3 系 DiT图像生成底座分辨率 1024×1024ControlNetcontrolnet-canny-sdxl / controlnet-depth-sdxl边缘或深度约束conditioning_scale 0.6-0.9LoRA按需求加载风格 LoRA风格迁移lora_strength 0.7-0.9采样器DPM 2M Karras / Euler去噪策略steps 30-40负面提示词通用 negative prompt 模板避免低质量—后处理IC-Light打光或放大模型精修单独环节执行组合使用时注意几个坑。ControlNet 的conditioning_scale设太高1.0会让生成结果被结构图完全锁死出现边缘锯齿或深度撕裂设太低0.4约束效果又不够构图会漂移。LoRA 的lora_strength叠加多个 LoRA 时要按“主体 LoRA 优先、风格 LoRA 其次”的顺序排列否则会出现风格打架。提示词在这个体系里反而是最弱的控制维度它的主要职责是补充 ControlNet 和 LoRA 无法表达的信息——比如光影方向、镜头焦距、材质质感。3.3 控制技术的本质把“人的意图”翻译成“模型的约束”报告把图像生成控制的本质归纳成四个字参数为笔意念成像。这个判断精准但容易让人误以为控制手段越多越好。实际上控制方式的选择取决于你对生成结果的预期偏差容忍度。在广告落地页这种需要精确构图的场景我会优先用 ControlNet 的深度图/分割图约束把主体位置和透视关系定死然后在边缘约束下微调颜色和光影在创意探索场景比如头脑风暴阶段我反而不建议加任何 ControlNet直接用 Prompt 配合随机种子去发散否则结构约束会过早收窄探索空间错过意外的好结果。报告提到的高分辨率图像处理与商业应用可以接在这里讲当你能精确控制构图和风格之后下一道坎就是出图分辨率。原生 1024×1024 的 DiT 模型能直接满足大部分网页端和社交媒体素材需求但海报、户外广告这类印刷级需求仍然要走到超分环节。专业领域的分辨率需求差异也很大医学影像的分辨率窗口集中在 256-1024遥感影像则是 1K 起步对高分辨率还原的要求完全不同这也解释了报告里“1K 是分水岭”的提法——通用场景够用专业场景刚起步。4. 视频生成三大关键词与 3D 生成关键路径4.1 规模化训练和下一帧预测背后的统一逻辑报告在视频生成部分把“规模化训练”和“下一帧预测”放在相邻位置是有用意的前者是训练范式后者是任务定义。视频生成的难点在于比图像多了一个时间维度连续帧之间的时序连贯性、主体一致性、运动规律合理性这三点决定了生成视频是“像动画”还是“像实拍”。自回归方案把视频离散成 token 序列逐帧预测优点是时间建模直接缺点是训练和推理成本高、误差会随帧数累积扩散方案用噪声迭代的方式一次性/分段生成帧序列优点是空间质量高缺点是时序连贯性不如自回归方案容易控制。DiT 架构恰好能整合两者——用 Transformer 的空间注意力和时间注意力同时建模帧内像素关系和帧间时序关系这也是报告说 DiT 成为主流方向的根本原因。从工程角度看“下一帧预测”这个视角给视频生成的评估提供了一个很好的切入点与其盯着 FVD视频生成质量评估指标这种全局指标不如直接看第 N 帧和真实视频第 N 帧的 PSNR峰值信噪比和 LPIPS感知相似度曲线观察误差随帧数增加是线性累积还是指数爆炸——后者说明时间建模有问题。评估代码示例import torch import torch.nn.functional as F from torchmetrics.image import PeakSignalNoiseRatio, LearnedPerceptualImagePatchSimilarity def evaluate_video_frames(generated_frames, real_frames, devicecuda): psnr PeakSignalNoiseRatio().to(device) lpips LearnedPerceptualImagePatchSimilarity(net_typealex).to(device) frame_count len(generated_frames) psnr_scores [] lpips_scores [] for i in range(frame_count): gen generated_frames[i].unsqueeze(0).to(device) real real_frames[i].unsqueeze(0).to(device) psnr_scores.append(psnr(gen, real).item()) lpips_scores.append(lpips(gen, real).item()) return psnr_scores, lpips_scores这段代码按帧计算 PSNR 和 LPIPSPSNR 越高越好衡量逐像素重建质量LPIPS 越低越好衡量感知相似度。把每帧的数值画成曲线如果第 1 帧和最后一帧的 LPIPS 差距超过一个阈值比如 0.3基本可以判定模型的时间建模有问题。输出结果时要用dict方式返回 MP4 文件路径、JSON 帧级指标和时间戳映射方便直接接进评测系统。提示评估视频生成模型和评估图像模型有本质区别——前者必须考虑时间维度的一致性后者只需要看单帧质量。这也是为什么报告强调“视频生成引擎本质是一种受限的世界模型”因为预测下一帧本质上是在模拟运动规律。4.2 3D 生成的高斯泼溅路线3D 生成部分报告重点拆了两条线几何/材质还原Tripo 2.0、GRM、Unique3D 这类方案和高斯泼溅3D Gaussian Splatting。几何还原解决“建模问题”把单张图或几张图变成可用的 3D 网格材质还原解决“贴皮问题”在网格上生成 PBR 材质金属度、粗糙度、法线贴图高斯泼溅则另辟蹊径跳过网格重建直接用一堆带形状、颜色、透明度的 3D 高斯点去表达场景。它的渲染速度和训练效率优势在报告里写得很明确高质量渲染、实时性能、训练快。从应用角度我给一个选型建议静态物体雕像、道具、家具用高斯泼溅可以快速出效果但后续如果要进游戏引擎做物理交互还是需要转成网格。动态场景人、动物、风吹草动目前更成熟的做法是 NeuRBF 或 4D Gaussian Splatting这类技术把时间维度并入模型能处理一定程度的运动。报告里“真实世界模拟需要解决复杂度控制与数据获取”这个判断在 3D 生成领域同样成立——高质量 3D 数据的稀缺是所有几何还原方案的共同瓶颈。5. 端侧智能与 Agent从云端生成到端云协同5.1 为什么“端侧智能”是 AIGC 走向生产的必经之路报告覆盖的八大领域里端侧智能On-Device AI和 Agent 与前面讲的生成类技术定位不同生成类技术解决“能不能生成”端侧智能和 Agent 解决“生成的东西怎么在真实环境里跑起来”。以图像生成落地为例云端 DiT 模型生成一张图要 3-8 秒如果放在交互式创作工具里这样的延迟还能忍受但如果放在抽卡、实时编辑、批量出图这类场景就不得不做端云协同——端侧用小模型做实时预览和局部编辑云端用大模型做精修和放大。当前的开源工具链里OpenVINO 和 MNN 是两条比较成熟的端侧部署路径前者对 Intel/Arc 系列核显和独立显卡支持较好后者主要面向手机端 NPU 场景。我在本地用 OpenVINO 跑过 SDXL-Turbo 的 INT8 量化版本单次推理延迟能压到 1 秒以内效果比原版略降但完全可用。import openvino as ov from pathlib import Path core ov.Core() model_path Path(sdxl-turbo-int8.xml) # 读入 IR 格式模型并编译到 NPU或 GPU设备 compiled_model core.compile_model(model_path, device_nameGPU.0) # 推理输入格式: [1, 4, 64, 64] 的潜空间噪声 [1, 77, 2048] 的文本编码 latent compiled_model([noise_latent, text_embedding])参数说明device_name可选GPU.0独立显卡、NPUAI 加速器或CPU实际部署时要先调用core.available_devices查看平台支持情况INT8 量化模型对比 FP16 版本推理速度提升约 2-3 倍显存占用下降约一半但图像细节会有轻微损失。如果端侧算力还不够退一步的做法是裁剪采样步数——Turbo 系列模型只需 1-4 步采样即可出图比标准模型的 30-40 步少一个数量级。报告把这类端侧模型的能力边界定义为“做减法”小模型做不了复杂构图但能快速出个雏形云端再接手精修。5.2 Agent 化工具链的收敛从“能生成”到“能办事”这版报告里 Agent 相关领域最大的变化是 Agent 从对话机器人向工具调用和结果验证收敛。DeepSeek、Kimi、豆包、通义、腾讯元宝这类助手都已经叠加了解析用户上传 PDF、Excel 的能力以及调用外部工具完成检索和计算的链路。做 Agent 的工程师都知道模型参数决定能力下限但决定体验上限的是工具链的稳定性和错误恢复能力。在 Agent 链路里模型的选择完全可以参数化配置不必绑定某一家。下面这个 YAML 片段展示的是一个可插拔配置model: provider: one_of[deepseek, kimi, doubao, qwen, yuanbao] temperature: 0.7 max_tokens: 4096 toolchain: pdf: marker image: volc_vision / qwen_vl retrieval: bge-m3 faiss security: output_filter: on参数说明provider字段把模型供应商做成可配置项方便在多个模型之间切换temperature控制生成随机性代码生成任务建议调到 0.2创意写作可以调到 0.8toolchain里的pdf解析器和 OCR 组件都要做好输入输出接口。Agent 的稳定性是实际落地时最大的坎——模型能力反而是现在最不缺的部分。报告里“工具应用 → 社区运营 → 数据反馈 → 模型优化”的数据飞轮逻辑在 Agent 领域同样成立模型从工具调用反馈里学会更好地调用工具工具的使用数据反过来优化模型这比单纯堆参数靠谱得多。谁先跑通工具链和反馈闭环谁就最先拿到可落地的 Agent 产品而不是停留在“能聊天、能生成”的演示阶段。5.3 把这份报告变成自己的技术雷达从读到用的方法读完这份报告最值得做的不是记住 50 个关键词的定义而是把关键词按“技术成熟度”和“对你所在业务的影响度”两个维度标到坐标图上。横轴是成熟度从论文实验到生产可用纵轴是相关性和你当前项目的关联强度然后把报告里提到的“本质洞见”逐一放到自己的判断框架里做交叉检验。比如我在做图像生成工具时看到“控制正从描述性向操作性演进”对应的行动方案就是优先接入 ControlNet 和可编辑工作流而不是继续调 Prompt 模板看到“1K 分辨率是分水岭”就会评估当前业务是否真的需要原生 2K 以上的生成能力还是先把它标注为“待技术成熟再跟进”。这样把报告的信息密度转译成自己的判断依据才算真正把它读进去了。本文还有配套的精品资源点击获取
返回列表