
【Bug已解决】SmolVLM Error due to incorrect padding calculation in video processor 解决方案一、现象长什么样用 SmolVLMHuggingFace 的小视觉语言模型处理视频输入时video processor 在把多段不同长度/分辨率的视频 batch 化时报错RuntimeError: stack expects each tensor to be equal size, but got [3, 8, 224, 224] and [3, 12, 224, 224]或ValueError: padding size should be non-negative, got -N又或者不报错但模型输出乱因为 padding 把帧塞到了错误的轴时间维和空间维混淆。最迷惑的是处理单张图像没事一上视频多帧序列就炸。本质video processor 要把一个 batch 里不同帧数的视频对齐pad 到最大帧数但 padding 计算用了错误的维度/符号导致要么 pad 出负尺寸-N要么把帧数维和空间维搞混stack 时形状不一致。SmolVLM 的视频输入是[batch, frames, channels, H, W]或[B, F, C, H, W]五维。padding 必须作用在 **frames时间维**把短视频补到最长视频的帧数。如果代码误把帧数差用到了空间维、或在计算max_frames - this_frames 时符号反了得到负数就触发上述错误。二、背景video processor 的核心任务是给定一个 batch 的视频每个视频解码出不同数量的帧如视频 A 8 帧、视频 B 12 帧需要把它们对齐成统一形状才能torch.stack成五维 batch。正确做法找出 batch 里最大帧数F_max对每个视频计算pad F_max - F_i应为非负在该视频的frames 维第 1 维末尾补pad个全零帧或复制帧stack成[B, F_max, C, H, W]。SmolVLM的这个 padding 计算 bug 常见在维度错把pad应用到H/W空间维或C而非 frames 维符号错pad F_i - F_max帧数少的视频得到负数F.pad收到负值 →ValueError: padding size should be non-negative先 stack 后 pad想先把不同帧数的 tensor stack 再 pad但 stack 本身就要求等尺寸于是RuntimeError: stack expects equal sizepadding_side 处理错left padding 时帧插在前面index 计算错误。下面用可运行代码复现padding 用错维度/符号导致 stack 失败。三、根因根因一句话SmolVLM 的 video processor 在把不同帧数的视频对齐时padding 计算用了错误的维度把帧数差用到空间维或错误符号得到负 pad导致 stack 形状不一致或padding size negative错误。三个具体失配padding 维错pad 应用到空间维而非 frames时间维。符号错pad F_i - F_max为负触发ValueError: negative padding。先 stack 后 pad不等尺寸就 stack直接RuntimeError。四、最小可运行复现用纯 Python 模拟padding 维度/符号算错导致对齐失败from dataclasses import dataclass from typing import List def bad_pad(videos: List[int]): 模拟错误用帧数差去 pad 空间维 符号反了。 f_max max(videos) results [] for f in videos: pad f - f_max # 错误符号帧数少 - 负数 if pad 0: raise ValueError(fpadding size should be non-negative, got {pad}) results.append(f pad) return results def good_pad(videos: List[int]): f_max max(videos) # 正确pad f_max - f非负作用在 frames 维 return [f (f_max - f) for f in videos] def main(): videos [8, 12, 10] # 不同帧数 try: bad_pad(videos) except ValueError as e: print(复现到报错:, e) print(正确对齐后各视频帧数:, good_pad(videos)) # [12,12,12] if __name__ __main__: main()运行会打印复现到报错: padding size should be non-negative, got -4——正是 video processor padding 符号错的本质。五、解决方案第一层最小直接修复最立竿见影的修复padding 必须在 frames时间维、用pad F_max - F_i恒非负且先 pad 到统一帧数再 stack绝不先 stack。import torch def collate_videos(video_tensors): 修复按 frames 维 pad 到最大帧数再 stack。 # video_tensors: list of [F_i, C, H, W] f_max max(v.shape[0] for v in video_tensors) padded [] for v in video_tensors: pad_len f_max - v.shape[0] if pad_len 0: # 在 frames 维第 0 维末尾补零帧 zero torch.zeros(pad_len, *v.shape[1:], dtypev.dtype) v torch.cat([v, zero], dim0) padded.append(v) return torch.stack(padded, dim0) # [B, F_max, C, H, W] def main(): a torch.randn(8, 3, 224, 224) b torch.randn(12, 3, 224, 224) batch collate_videos([a, b]) print(batch 形状:, tuple(batch.shape)) # [2, 12, 3, 224, 224] if __name__ __main__: main()第一层修复让 padding 维正确、符号非负、先 pad 后 stackvideo processor 不再报错。六、解决方案第二层结构性改进把视频 batch 对齐收口成一个VideoCollator固化求 max 帧数 → frames 维 pad → stack的流程并校验输入维度避免维度/符号再错。import torch from dataclasses import dataclass from typing import List dataclass class VideoCollator: pad_value: float 0.0 def collate(self, videos: List[torch.Tensor]) - torch.Tensor: # 校验输入都是 [F, C, H, W] for v in videos: if v.dim() ! 4: raise ValueError(f视频张量应为 4 维 [F,C,H,W]实际 {v.dim()}) f_max max(v.shape[0] for v in videos) out [] for v in videos: pad f_max - v.shape[0] if pad 0: z torch.full((pad, *v.shape[1:]), self.pad_value, dtypev.dtype) v torch.cat([v, z], dim0) out.append(v) return torch.stack(out, dim0) def main(): c VideoCollator() vids [torch.randn(8, 3, 224, 224), torch.randn(10, 3, 224, 224)] batch c.collate(vids) print(VideoCollator 输出:, tuple(batch.shape)) # [2, 10, 3, 224, 224] if __name__ __main__: main()第二层的关键是VideoCollator把维度校验 frames 维 pad stack固化任何维度/符号错误都在 collate 内被拦截不会传到模型。七、解决方案第三层断言 / CI 守护加 pytest 守护(1) 不同帧数视频 collate 后形状统一为[B, F_max, C, H, W](2) pad 长度恒非负(3) 输入维度错时 collator 应报错。import torch import pytest def collate(videos): f_max max(v.shape[0] for v in videos) out [] for v in videos: pad f_max - v.shape[0] if pad 0: z torch.zeros(pad, *v.shape[1:], dtypev.dtype) v torch.cat([v, z], dim0) out.append(v) return torch.stack(out) def test_uniform_shape(): a torch.randn(8, 3, 224, 224) b torch.randn(12, 3, 224, 224) batch collate([a, b]) assert tuple(batch.shape) (2, 12, 3, 224, 224) def test_pad_non_negative(): videos [torch.randn(8, 3, 224, 224), torch.randn(12, 3, 224, 224)] f_max max(v.shape[0] for v in videos) for v in videos: assert (f_max - v.shape[0]) 0 def test_wrong_dim_raises(): with pytest.raises(Exception): collate([torch.randn(3, 224, 224)]) # 3 维缺 frames 维 if __name__ __main__: pytest.main([__file__, -q])CI 里test_uniform_shapetest_pad_non_negative通过就能保证 video processor 的 padding 计算正确杜绝 SmolVLM 视频对齐的回归。八、排查清单SmolVLM 视频处理器报 padding 错误时按此顺序查确认是视频多帧而非图像图像无 frames 维视频才有padding 只在视频路径触发。打印各视频帧数看是否不等长不同帧数 batch 化必 pad。检查 pad 符号确认pad F_max - F_i非负不是反过来。检查 pad 维度pad 必须作用在 frames时间维不是 H/W/C。先 pad 后 stack绝不等尺寸就torch.stack。用 VideoCollator 兜底统一求 max → frames 维 pad → stack并校验维度。检查 padding_sideleft pad 时帧插在前面index 计算别错。九、小结SmolVLM 视频处理器因 padding 计算错误报错根因不在模型而在video processor 把不同帧数的视频对齐时padding 计算用了错误的维度把帧数差用到空间维或错误符号F_i - F_max得到负 pad且可能先 stack 后 padstack 要求等尺寸——视频是五维[B,F,C,H,W]padding 必须作用在 frames 维、用非负长度先 pad 再 stack。修复三层第一层padding 在 frames 维、用F_max - F_i非负、先 pad 后 stack第二层用VideoCollator固化维度校验 frames 维 pad stack第三层用 pytest 断言对齐后形状统一、pad 非负、错维报错。记住视频对齐 pad 的是时间维帧数不是空间维pad 长度永远是 max 减自己非负。