尧图网站设计 尧图网站设计YAOTU DESIGN
ARTICLE DETAIL

资讯详情

深耕网站设计与一线实操的经验洞察。

本地跑通AI视频分析:一条命令把长视频变成文字摘要

本地跑通AI视频分析:一条命令把长视频变成文字摘要 本地跑通AI视频分析一条命令把长视频变成文字摘要【免费下载链接】video-analyzerAnalyze videos using LLMs, Computer Vision and Automatic Speech Recognition项目地址: https://gitcode.com/gh_mirrors/vi/video-analyzervideo-analyzer 是一款完全在本地跑的AI视频分析工具把视频转文字、给关键帧写描述最后自动合成一份结构化视频摘要——那条你没空看完的 20 分钟录屏处理一遍就能变成能直接读的文本。需要本地视频分析、视频自动总结又不想把文件传上云端的人往下看从安装到第一次出结果最短路径如下。一条命令安装并跑通第一次AI视频分析环境只需要两样Python 3.11 和 FFmpegUbuntu 执行sudo apt install ffmpegmacOS 用brew install ffmpeg。然后克隆仓库、建虚拟环境、装包、拉本地视觉模型git clone https://gitcode.com/gh_mirrors/vi/video-analyzer cd video-analyzer python3 -m venv .venv source .venv/bin/activate pip install . ollama pull llama3.2-visionWindows 上激活虚拟环境换成.venv\Scripts\activate。拉完模型后执行ollama serve启动本地服务若安装时已自动拉起可跳过。确认ollama list里能看到 llama3.2-vision 后第一次分析就一条命令video-analyzer demo.mp4跑完后终端会直接打印转录文本和视频摘要完整结果落在output/analysis.json。走到这一步你就已经跑通了整条流程。它是怎么看视频的转写、选帧、写总结的三阶段流水线把它想成一个边看边做笔记的人分三步走听录音Whisper 把音频转成带时间戳的文字音频太差时自动降级处理不会直接崩掉挑画面OpenCV 不按每秒一帧硬来而是按画面差异度挑出有代表性的关键帧重复的画面不会反复送检写总结视觉大模型逐帧描述画面且每帧分析都带着前几帧的描述上下文避免叙述跳脱最后再把全部帧描述和转录文本合并写成整段视频的自然语言摘要。对应上图Video 进入后先走 Transcribe 和 Frame Selection中间的 Describe Frames 与 LLM Server 反复交互当前帧 历史描述最终 Describe Video 汇总输出所有内容一起写入 analysis.json。教学录屏、产品演示、长讲座都能走同一条流程差别只在你要多少帧。本地还是云端按隐私、速度、成本选模型方案隐私速度成本Ollama 本地 · llama3.2-vision帧和音频都不出机器受限于本机配置冷启动较慢免费OpenRouter 免费模型 · meta-llama/llama-3.2-11b-vision-instruct:free帧图会上传到云端快本机无需装大模型免费商用视觉模型 · gpt-4o帧图上传至服务商最快按用量计费一句话选型素材敏感选本地机器带不动就选免费云端要效果且能付费选商用。⚠️ 本地跑 llama3.2-vision 需要至少 16GB 内存推荐 32GB或 12GB 显存的显卡、32GB 的 Apple M 系列机器达不到就直接走云端video-analyzer video.mp4 \ --client openai_api \ --api-key your-key \ --api-url https://openrouter.ai/api/v1 \ --model meta-llama/llama-3.2-11b-vision-instruct:free调精度与速度只认这几个开关帧密度--max-frames 50限制总帧数它会按时间均匀采样整段视频而不是只取前 50 帧更细的调节在 config/config.json 里改frames.per_minute默认 60降到 10~30 能明显提速。转录模型规模--whisper-model small比默认的 medium 转得更快、精度略降追求准确就换 large。提示词--prompt 只描述画面中的操作步骤和界面变化把分析导向你真正关心的维度而不是泛泛的场景描写。输出长度config 里response_length的 frame / narrative 分别限制单帧描述和整体摘要的长度嫌摘要啰嗦就调小 narrative。输出文件怎么读analysis.json 的四段结构默认跑完只保留一个文件output/analysis.json中间的 frames/ 目录和 audio.wav 会自动清掉想留就加--keep-frames。按阅读价值排序video_description整段视频的自然语言摘要通常就是你要的答案frame_analyses逐帧描述每帧含场景、动作、与上一帧的连续性说明适合核对细节transcript完整转录文本segments 里每段带 start / end 时间戳方便按时间戳回看原片metadata本次用了什么模型、抽了几帧、转写是否成功排查问题时先看它。结构示意简化{ metadata: { frames_extracted: 5, transcription_successful: true }, transcript: { text: ..., segments: [ { start: 1.78, end: 2.24 } ] }, frame_analyses: [ { response: Frame 0: Setting/Scene... Action/Movement... } ], video_description: { response: 整段视频的摘要文字 } }遇到问题先看这里太慢、不准、内存不够Q跑得慢要等很久A先砍工作量--max-frames 30减少送检帧数--whisper-model small降低转录开销机器带不动大模型就直接--client openai_api走云端。另外长视频中断过可以用--start-stage 2跳过抽帧和转写直接从帧分析继续前提是上次带了--keep-frames。Q描述不准跟画面对不上A换更强的视觉模型如--model gpt-4o同时用--prompt把要求写具体例如逐条列出画面中出现的界面元素。转录不准会连带拉低总结质量原片声音模糊时先别怪模型。Q内存不够跑到一半崩了A本地方案至少 16GB 内存推荐 32GB带显卡则 12GB 显存起步配置不够就转云端。临时缓解可用--duration 600只处理前 10 分钟配合--whisper-model tiny把转录降到最省。下一步挑一段 5 分钟左右的视频把上面的命令跑一遍对照 output/analysis.json 逐段看输出。全部参数和配置项的说明见官方文档docs/USAGES.md【免费下载链接】video-analyzerAnalyze videos using LLMs, Computer Vision and Automatic Speech Recognition项目地址: https://gitcode.com/gh_mirrors/vi/video-analyzer创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表