尧图网站设计 尧图网站设计YAOTU DESIGN
ARTICLE DETAIL

资讯详情

深耕网站设计与一线实操的经验洞察。

CLEVR

CLEVR 其实这篇 CLEVR 论文你只需要抓住一条主线作者的目标不是提出新模型而是设计一个可控的数据集用来判断模型到底会不会视觉推理。CLEVR_A_Diagnostic_CVPR_2017_paper.pdfPDF1. Scene Graph先把场景结构化CLEVR 先随机生成场景再用 Blender 渲染图像。每个物体都知道真实的物体之间还知道因此Attributes描述一个物体本身Relations描述物体之间的关系这些信息共同构成 GT Scene Graph。2. Functional Program决定“这道题要怎么推理”Scene Graph 只是告诉我们场景里有什么真正决定一道题测试什么能力的是Functional Program。例如What color is the cube to the right of the yellow sphere?可以表示成其中每一个 function 都可以近似看成一个推理步骤复杂问题本质上就是把简单操作组合起来Compositional Question 多个基础 reasoning operations 的组合论文就是通过这些基本函数来构造复杂问题。3. Question Family控制生成哪种问题作者先设计不同的Question Family每个 family 包含Program Template 决定推理结构例如Text Template 再把它变成自然语言。所以可以简单记成Scene Graph 提供“问什么物体”Functional Program 提供“怎么推理”Text Template 提供“怎么说出来”CLEVR 一共设计了 90 个 question families。4. 生成问题时还要验证真的需要这些推理吗作者会在 GT Scene Graph 上执行这个 program。如果目标不唯一例如sphere 右边有三个 cube那么问题属于ill-posed question直接丢弃。如果整张图只有一个 cube那么the cube to the right of the sphere中的“right of the sphere”其实没必要这就是degenerate question也丢弃。因此 CLEVR 不只是生成“看起来很复杂”的问题而是尽量保证问题声称需要某种推理 ⇒ 实际上也真的需要这种推理5. 最后为什么它叫 Diagnostic Dataset因为每道题都有 Functional Program所以作者知道用了什么 attribute、用了什么 relation、用了多少 reasoning steps、是 chain 还是 tree structure这样模型答错以后不只是知道accuracy 低而是可以进一步判断它到底弱在attribute recognition还是 relation reasoning 还是 long reasoning chain、还是 compositional generalization论文也发现随着真正需要执行的 reasoning steps 增加模型表现会下降所以整篇论文可以最终压缩成一句CLEVR 先控制 Attributes 和 Relations → 再用 Functional Program 把它们组合成问题 → 从而精确控制并分析 Reasoning Steps。
返回列表