尧图网站设计 尧图网站设计YAOTU DESIGN
ARTICLE DETAIL

资讯详情

深耕网站设计与一线实操的经验洞察。

【CVPR 灵感落地】Jetson 上跑 Streaming Vision Agent:双 Qwen3-VL-2B + 滚动多模态记忆,边拍边问“刚才发生了什么”

【CVPR 灵感落地】Jetson 上跑 Streaming Vision Agent:双 Qwen3-VL-2B + 滚动多模态记忆,边拍边问“刚才发生了什么” 适合人群玩 Jetson / VLM / 多模态 Agent、想做“实时视频问答”的开发者与研究生阅读收益搞清「单帧检测 vs 离线短视频理解 vs 在线滚动记忆」的差别并拿到可跑的双 2B 部署路径硬件验证reComputer MiniJetson AGX Orin 64GB· JetPack 7.2完整 Wikihttps://wiki.seeedstudio.com/streaming_vision_agent_on_jetson/开源仓库https://github.com/xbs0325/Streaming-Vision-Agent-Orin灵感来源WorldMMCVPR 2026 Highlight多模态记忆思路 —— 本 demo 是边缘侧在线滚动窗口适配并非论文离线 EgoLife 复现痛点先说清楚大多数 Jetson 视觉 Demo 其实“没有记忆”市面上常见两类演示单帧检测每一帧彼此独立物体离开画面历史就没了离线短片段理解录几秒视频丢给 VLM 跑一遍 —— 片段结束对话也断了两边都很难回答这种问题“刚才桌上放下去的是什么” “那个东西是什么时候消失的” “一分钟前画面里发生了什么”因为系统没有跨时间的在线状态。Streaming Vision Agent要做的事是在边缘设备上维护一段在线滚动的多模态记忆视觉嵌入、情节事件、语义事实摄像头还在跑的时候你就能带着证据帧 / 片段去 Ask。设计灵感来自 WorldMMCVPR 2026的动态多模态记忆思路本文对应的是 Seeed Jetson 上的实时滚动窗口 demo不是论文 benchmark 复刻。架构一览记忆在写问答不堵层作用Visual memoryVLM2Vec 帧嵌入 JPEG 证据约每 5 秒Episodic memoryQwen3-VL-2B#1出现 / 移动 / 消失等事件约每 45 秒Semantic facts实体状态is_at/absent_from/usually_at 时间线Ask检索记忆 → Qwen3-VL-2B#2结合轨迹与证据作答数据流可以记成Camera ──► visual ~5s (VLM2Vec) └──► episodic ~45s (Qwen3-VL-2B recognition) Ask ──► retrieve memory ──► Qwen3-VL-2B answer浏览器打开http://jetson-ip:8790/就能看到实时画面、滚动记忆状态、Ask 交互。为什么要加载两个 Qwen3-VL-2B一个负责后台识别写记忆一个负责前台问答。双实例 独立锁 / CUDA stream避免 Ask 被 recognition 堵住。显存紧可以用--shared-2b共用一个 2BAsk 会等 recognition。硬件与资源门槛先看再下模型项目配置设备reComputer J501 Mini已验证J501 Mini ·JetPack 7.2L4T 39.2.0内存 / 磁盘建议 64 GB RAM· ≥50 GB 可用磁盘模型 venv摄像头USB UVC / V4L2/dev/video0这套默认是双 2B 实时链路资源胃口不小Orin 64GB 级别会舒服很多。部署步骤按顺序来1. 克隆仓库git clone https://github.com/xbs0325/Streaming-Vision-Agent-Orin.git cd Streaming-Vision-Agent-Orin2. 创建 Jetson Python 环境bash script/jetson_setup.sh默认 venv~/leucus/.venv-worldmm可用环境变量WORLDMM_VENV覆盖。激活并导出关键变量source ${WORLDMM_VENV:-$HOME/leucus/.venv-worldmm}/bin/activate export PYTHONPATH$PWD/src:$PWD:$PYTHONPATH export WORLDMM_ATTN_IMPLsdpa export WORLDMM_QWEN_DEVICE_MAPcuda:0 export WORLDMM_DTYPEbfloat16 export WORLDMM_MODELS${WORLDMM_MODELS:-$HOME/leucus/models/worldmm} export HF_HOME$WORLDMM_MODELS/hf_home unset HF_ENDPOINT3. 下载模型bash script/jetson_download_models.sh模型默认双 2B 直播是否必需Qwen3-VL-2B-Instruct是加载两次recognition AskQwen3-Embedding-4B是Qwen2-VL-2B-Instruct VLM2Vec-V2.0是视觉记忆Qwen3-VL-8B-Instruct可选WORLDMM_DOWNLOAD_8B1或--episodic-model 8bQwen 权重走 ModelScopeVLM2Vec 走 Hugging Face。首次下载视网络而定建议提前留足磁盘和时间。启动实时 Demo接好 USB 摄像头后bash run.sh # 或 python script/orin_live.py --ui-port 8790 --window-min 8 \ --visual-interval 5 --episodic-interval 45浏览器访问http://jetson-ip:8790/默认就是dual 2B。常用可选参数参数含义--episodic-model 8b用 Qwen3-VL-8B 加强识别--shared-2b单 2B 兼任两角省显存Ask 会等 recognition--window-min 10拉长滚动记忆窗口可选冒烟测试python script/orin_smoke.py --vlm qwen3vl-2b --seconds 20 \ --vlm2vec-base $WORLDMM_MODELS/Qwen2-VL-2B-Instruct演示效果你应该观察到什么Wiki 上提供了三段 CDN 演示视频建议直接点开看滚动记忆 Askhttps://files.seeedstudio.com/wiki/Jetson_AGX_Orin/streaming_vision_agent_demo_01.mp4https://files.seeedstudio.com/wiki/Jetson_AGX_Orin/streaming_vision_agent_demo_02.mp4https://files.seeedstudio.com/wiki/Jetson_AGX_Orin/streaming_vision_agent_demo_03.mp4场景预期场景预期行为稳定视角实时帧 状态 pillepisodic / visual 计数随时间增加在画面中心放置/拿走物体或其他操作确认后出现 episodic 事件可问 “刚才放下了什么”Ask“What was just put down?”回答引用时间线 / 事实并可附带证据 JPEG 或片段识别侧用了中心偏置触发以及 FULL CENTER crop减轻边缘手部 / 鼠标干扰。使用心态短窗口双 2B demo 里个别 Ask 回合可能出现「文字说的是 A检索到的证据图是稍早的 B」——检索会贴最近视觉证据不一定是完美身份对齐。交互时尽量居中、一次一个物体结果会干净很多。本 Demo 默认模型一览角色默认模型Episodic recognitionQwen3-VL-2B-Instruct实例 #1Ask / answerQwen3-VL-2B-Instruct实例 #2文本嵌入Qwen3-Embedding-4B视觉嵌入Qwen2-VL-2B-Instruct VLM2Vec-V2.0 LoRA故障排查问题处理打不开/dev/video0ls /dev/video*试--device /dev/video1huggingface_hubFileMetadataErrorunset HF_ENDPOINT别用 hf-mirrorhub / transformers 冲突保持huggingface_hub0.34,1jetson_setup.sh已钉OOM / 极慢别并行跑其他重 GPU 任务试--shared-2b或加大--episodic-intervalAsk 感觉被堵住确认没有开--shared-2b默认 dual-2B 应走独立 stream端口占用fuser -k 8790/tcp后重开项目地址GitHub - xbs0325/Streaming-Vision-Agent-Orin: Streaming Vision Agent for Jetson AGX Orin (JP7). Dual Qwen3-VL-2B rolling memory. Inspired by WorldMM. · GitHub边缘侧 VLM 正从「跑通一张图」走向「跑通一段时间」。Streaming Vision Agent 把视觉 / 情节 / 语义三层记忆压进 Jetson 的滚动窗口并拆成双 2B 避免问答与写记忆互抢——这比再贴一张 YOLO 框更接近「能对话的现场视觉 Agent」。如果你已经在 Orin 上跑过 Qwen-VL下一步不妨试试让模型记住过去几十秒而不是只看当前帧。评论区欢迎聊聊你更想用它做桌面助手、产线追溯还是安防回放提问致谢论文引用本边缘 demo 灵感来自WorldMM— Dynamic Multimodal Memory Agent for Long Video ReasoningCVPR 2026 Highlight将 visual / episodic / semantic 三层记忆思路适配到 Jetson 实时滚动窗口。inproceedings{yeo2026worldmm, title {WorldMM: Dynamic Multimodal Memory Agent for Long Video Reasoning}, author {Yeo, Woongyeong and Kim, Kangsan and Yoon, Jaehong and Hwang, Sung Ju}, booktitle {Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR)}, month {June}, year {2026}, pages {25599-25609} }同时感谢 HippoRAG、VLM2Vec 以及上游 WorldMM 实现Apache-2.0。
返回列表