尧图网站设计 尧图网站设计YAOTU DESIGN
ARTICLE DETAIL

资讯详情

深耕网站设计与一线实操的经验洞察。

Kornia RandomAffine 与 RandomPerspective 的 CUDA 编译修复与随机生成器设备迁移语义

Kornia RandomAffine 与 RandomPerspective 的 CUDA 编译修复与随机生成器设备迁移语义 计算机视觉深度学习人工智能图像处理【免费下载链接】kornia 空间人工智能的几何计算机视觉库项目地址https://gitcode.com/kornia/kornia点击查看免费下载导读本篇文章围绕 Kornia 变更记录 changelog.d/4517.fixed.md 展开聚焦两个核心工程问题其一RandomAffine与RandomPerspective在 CPU 生成几何参数、CUDA 执行增强时无法通过torch.compile/torch.export编译的缺陷修复其二增强模块与随机生成器在.to()、.cuda()、.cpu()、.double()等设备/精度迁移时的语义统一。读完本文你将理解该修复的触发场景、参数放置与 RNG 消耗保持的设计取舍、尚未覆盖的上游缺陷以及标准模块迁移语义在生成器上的落地方式。背景CPU 常量张量与 CUDA 编译的矛盾PyTorch 的torch.compile与torch.export对设备一致性要求严格当一个张量位于 CPU、而计算图在 CUDA 上执行时编译/导出链路会把这类“CPU 常量”当作需要复制的常量处理。Kornia 的随机几何参数生成器Random Generator默认在 CPU 上以float32生成参数见 AffineGenerator 文档这带来一个常见工作流aug K.RandomAffine(degrees(-15.0, 20.0), p1.0).to(cuda) # 图像在 CUDA而生成器内部在 CPU 采样参数再搬运到 CUDA在torch.compile下RandomAffine与RandomPerspective内部构造的常量张量如透视变换的角点坐标、仿射变换的中心点、Uniform采样的上下界会触发上游的 CPU 常量传输缺陷导致编译失败或数值异常。修复内容一CPU 生成参数 CUDA 编译的兼容changelog.d/4517.fixed.md明确修复后的行为契约RandomAffine和RandomPerspective现在可以在 CUDA 上编译同时几何参数仍由 CPU 生成包括数值范围和 CPU 张量构造器范围无论是否移动增强模块本身。关键实现以 PerspectiveGenerator.make_samplers 为例Uniform采样器的上下界显式构造为指定 device/dtype 的张量self.rand_val_sampler Uniform( torch.tensor(0, devicedevice, dtypedtype), torch.tensor(1, devicedevice, dtypedtype), validate_argsFalse, )forward中角点常量也通过_constant_tensor显式落到目标设备perspective.pystart_points _constant_tensor( [[[0, 0], [width - 1, 0], [width - 1, height - 1], [0, height - 1]]], device_device, dtype_dtype, )同理AffineGenerator.make_samplers 将degrees、translate、scale经_range_bound后.to(devicedevice, dtypedtype)生成各维度的UniformDistribution采样器forward输出的平移、缩放、角度等参数同样全部显式转换到_extract_device_dtype提取的设备与精度。行为保证参数放置采样出的几何参数与生成的图像位于同一设备/精度供warp_affine、get_perspective_transform等下游算子直接消费返回 dtypeforward返回的参数字典保持生成器配置的 dtype默认float32RNG 消耗保持修复不改变随机数的消耗顺序与数量torch.manual_seed之后的采样结果与修复前一致。触发前提该编译工作区仅覆盖RandomAffine与RandomPerspective两个变换。变更记录明确声明其余增强仍可能遇到上游的 CPU 常量传输缺陷包括RandomShear见 shear.pyRandomThinPlateSplineRandomErasing见 rectangle_earase.pyCenterCrop见 crop.py也就是说如果需要把上述变换纳入torch.compile/torch.export管线仍需等待上游 PyTorch 修复或自行规避。修复内容二随机生成器的标准模块迁移语义变更记录的第二段定义了设备/精度迁移的新契约其目标是与torch.nn.Module.to()的标准语义对齐。迁移语义规则仅指定 dtype 的.to()如.to(dtypetorch.float64)保持采样器所在设备不变仅更新 dtype仅指定 device 的.to()如.to(cuda)保持采样器 dtype 不变仅更新设备非法整数 dtype 请求如.to(torch.int64)在改变任何采样器之前抛出异常采样器状态保持不变Generator.to()/.cuda()/.cpu()/.double()以及父模块整体迁移注册缓冲区与采样器一起更新普通张量构造器属性如degrees、distortion_scale这类直接赋值的属性保留既有的放置优先级由forward中的_extract_device_dtype决定参见 affine.py。源码落点核心实现在 RandomGeneratorBasedef to(self, *args, **kwargs): Update sampler device and dtype using torch.nn.Module.to semantics. return super().to(*args, **kwargs) def _apply(self, fn, *args, **kwargs): # 跟随注册张量进行直接、便捷方法及父模块移动 out super()._apply(fn, *args, **kwargs) probe fn(torch.zeros((), deviceself.device, dtypeself.dtype)) dtype probe.dtype if probe.is_floating_point() else self.dtype self.set_rng_device_and_dtype(probe.device, dtype) return out_apply是nn.Module所有迁移方法的底层入口先用探针张量推导目标设备与 dtype再调用set_rng_device_and_dtypebase.py统一重建采样器并更新self.device/self.dtype从而保证UniformDistribution内部上下界的设备与精度和模块一致。测试验证测试 test_base.py 的TestAugmentationPartialTo覆盖了上述全部语义test_invalid_dtype_preserves_samplers.to(torch.int64)抛出TypeError匹配 only accepts floating point or complex dtypes且采样器对象不变generator.degree_sampler is samplertest_dtype_only_to_preserves_device/test_device_only_to_preserves_dtype验证module.to(device...)与module.to(dtype...)分别迁移设备与精度且不互相覆盖test_generator_moves_buffers_and_samplers覆盖.to()、便捷方法.cuda()/.cpu().half()/.double()与父模块nn.Sequential(generator).to(...)三种迁移路径断言generator.degrees与sampler_dict[degrees].low的设备、dtype 同步更新test_move_builds_samplers_once使用patch.object断言make_samplers只被调用一次避免迁移时重复重建采样器。实战建议编译场景只有RandomAffine与RandomPerspective得到编译保障组合中使用RandomShear、RandomErasing、CenterCrop等变换时建议先在torch.compile下做冒烟验证或暂时将这些变换移出编译区域。迁移顺序优先使用显式module.to(device..., dtype...)一步到位对生成器单独迁移时dtype-only 调用不会把采样器搬到 CPUdevice-only 调用不会降精度符合nn.Module直觉。非法 dtype不要对增强模块或生成器执行.to(torch.int64)之类整数 dtype 迁移——现在会在任何状态改变前直接报错。可复现性注意随机数在不同 device/dtype 之间不可复现base.py跨设备对照实验需固定采样设备。小结changelog.d/4517.fixed.md记录的是 Kornia 增强体系在“编译友好”与“迁移语义标准化”两个方向上的落点前者用显式设备/精度构造常量与采样器绕开上游 CPU 常量传输缺陷覆盖RandomAffine/RandomPerspective后者把生成器的设备迁移与nn.Module标准语义对齐并以完整的单元测试锁定行为。理解这两层契约能帮助你在torch.compile、torch.export及多设备训练管线中更安全地使用 Kornia 的随机几何增强。赞分享计算机视觉深度学习人工智能图像处理【免费下载链接】kornia 空间人工智能的几何计算机视觉库项目地址https://gitcode.com/kornia/kornia点击查看免费下载相关推荐如何在 VS Code 中安装 Roo Code Nightly 预发布构建并与稳定版并存如何在 VS Code 中安装 Roo Code Nightly 预发布构建并与稳定版并存 如果你想在稳定版发布之前体验 Roo Code 的最新改动需要安装计算机视觉人工智能深度学习图像处理Kornia 增强模块 CUDA torch.compile 常量搬运规避与采样器设备/dtype 迁移修复Kornia 增强模块 CUDA torch.compile 常量搬运规避与采样器设备/dtype 迁移修复 本篇文章围绕 Kornia 增强augmenta计算机视觉人工智能深度学习图像处理Opik Python SDK rest_client 全解直接操作 REST API 客户端层的资源客户端分类与实战用法Opik Python SDK rest_client 全解直接操作 REST API 客户端层的资源客户端分类与实战用法 本文基于 Opik Python计算机视觉深度学习人工智能图像处理上一篇Thorium浏览器当Chromium遇上放射性元素的极致性能下一篇Cymist-2-v03-SFT环境友好型AI仅产生0.9kg CO2排放的绿色训练方案终极指南创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表