尧图网站设计 尧图网站设计YAOTU DESIGN
ARTICLE DETAIL

资讯详情

深耕网站设计与一线实操的经验洞察。

Pixelle-Video 全自动短视频引擎入门指南:从主题输入到成片输出的完整实战手册

Pixelle-Video 全自动短视频引擎入门指南:从主题输入到成片输出的完整实战手册 Pixelle-Video 全自动短视频引擎入门指南从主题输入到成片输出的完整实战手册【免费下载链接】Pixelle-Video AI 全自动短视频引擎 | AI Fully Automated Short Video Engine项目地址: https://gitcode.com/GitHub_Trending/pi/Pixelle-Video导读本文以 Pixelle-Video 项目文档中心的首页docs/zh/index.md为核心骨架系统讲解这款 AI 全自动短视频引擎的定位、核心功能、安装配置、费用方案与使用流程。作为一款「输入一个主题自动完成文案撰写、配图生成、语音合成、背景音乐与视频合成」的开源工具Pixelle-Video 面向零剪辑经验的内容创作者。读完本文你将掌握从零搭建环境、配置 LLM 与图像/视频服务、到生成第一个完整短视频的完整链路并理解其背后的模块化架构与可扩展的 ComfyUI 工作流机制。一、Pixelle-Video 是什么Pixelle-Video 是一款基于 Streamlit Python 构建的AI 全自动短视频生成引擎。官方文档给出的定位是「AI 视频创作工具——3 分钟生成一个短视频」核心卖点可以概括为只需输入一个主题其余全部交给系统自动完成。根据文档中心首页与 README.md 的说明一次完整的视频生成会自动串联以下环节✍️撰写视频文案由 LLM 根据主题智能创作解说词无需用户手写脚本生成 AI 配图 / 视频为每一句文案匹配 AI 生成的插图甚至可选用 WAN 2.1 等视频生成模型产出动态画面️合成语音解说支持 Edge-TTS、Index-TTS 等主流 TTS 方案并可上传参考音频进行声音克隆添加背景音乐可选用内置音乐或用户自备的 BGM让视频更有氛围一键合成视频将文案、画面、语音、音乐按模板合成为最终成片。其设计目标非常明确零门槛、零剪辑经验让视频创作「成为一句话的事」。功能亮点速览能力维度说明全自动生成输入主题后自动生成完整视频典型 5 分镜视频约 2-5 分钟出片AI 智能文案LLM 根据主题创作解说词支持多种模型预设AI 生成配图每个分镜自动配图支持 ComfyUI 工作流与直连 API 模型双通道AI 生成语音Edge-TTS、Index-TTS 等多种 TTS 工作流支持声音克隆背景音乐内置音乐、自定义音乐均可支持试听与音量调节视觉风格多种 HTML 模板可选涵盖竖屏 / 横屏 / 方形三种画幅灵活尺寸支持 1080x1920、1920x1080、1080x1080 等常见规格多种 AI 模型LLM 侧支持 GPT、通义千问、DeepSeek、Ollama、Claude、Moonshot 等原子能力灵活组合基于 ComfyUI / RunningHub 工作流可替换图像、视频、TTS 等任意能力设计溯源官方文档注明Pixelle-Video 的设计受到 Pixelle-MCP、MoneyPrinterTurbo、NarratoAI、MoneyPrinterPlus、ComfyKit 等开源项目的启发。其中 ComfyKit 作为 ComfyUI 工作流封装库是 Pixelle-Video 调用本地 ComfyUI 与云端 RunningHub 的核心依赖见 pixelle_video/service.py 中from comfykit import ComfyKit的导入。二、快速开始三步上手文档首页给出了最小上手路径共三步安装 Pixelle-Video下载并安装项目。Windows 用户推荐使用免装 Python 环境的一键整合包macOS / Linux 用户从源码安装配置服务配置 LLM 与图像生成服务生成第一个视频开始创作第一个视频。三、安装Windows 整合包与源码安装双路径完整安装步骤详见 安装指南这里提炼关键信息。系统要求类别要求必需Python 3.10Windows / macOS / Linux包管理器 uv推荐或 pip可选NVIDIA 显卡6GB 显存用于本地运行 ComfyUI稳定的网络连接用于调用 LLM 与图像 API路径一Windows 一键整合包推荐 Windows 用户整合包的最大优势是无需安装 Python、uv 或 ffmpeg开箱即用从项目 GitHub Releases 页面下载最新整合包并解压到任意目录双击运行start.bat启动 Web 界面该脚本位于仓库 packaging/windows/templates/start.bat可在 packaging/windows 目录查看打包相关配置浏览器自动打开http://localhost:8501首次使用只需在「⚙️ 系统配置」中配置 API 密钥即可开始使用。路径二从源码安装macOS / Linux / 需要自定义的用户第一步克隆项目git clone https://github.com/AIDC-AI/Pixelle-Video.git cd Pixelle-Video第二步安装依赖推荐使用uv比传统 pip 更快、更可靠# 安装 uv如尚未安装 curl -LsSf https://astral.sh/uv/install.sh | sh # 安装项目依赖uv 会自动创建虚拟环境 uv sync也可以使用 pippython -m venv venv # Windows: venv\Scripts\activate # macOS/Linux: source venv/bin/activate pip install -e .注意从源码运行时系统还需要ffmpeg用于视频合成处理。macOS 可用brew install ffmpegUbuntu/Debian 可用apt install ffmpegWindows 需将 ffmpeg 的bin目录加入 PATH安装后可用ffmpeg -version验证。第三步验证安装# 使用 uv uv run streamlit run web/app.py # 或使用 pip需先激活虚拟环境 streamlit run web/app.py浏览器应自动打开http://localhost:8501并显示 Web 界面。Web 入口是 web/app.py它通过 Streamlit 的st.navigation定义了两个页面首页「 Home」(web/pages/1__Home.py) 与历史记录页「 History」(web/pages/2__History.py)。可选本地安装 ComfyUI如果希望本地运行图像生成完全免费方案需要额外部署 ComfyUIgit clone https://github.com/comfyanonymous/ComfyUI.git cd ComfyUI pip install -r requirements.txt python main.pyComfyUI 默认运行在http://127.0.0.1:8188之后在 Pixelle-Video 配置中填写该地址即可。注意 ComfyUI 需要自行下载对应的模型文件才能工作。四、配置LLM 与图像/视频服务安装完成后需要配置服务才能使用详见 配置说明。所有配置保存到仓库根目录的config.yaml文件中配置模板见 config.example.yaml需自行复制为config.yaml并填写切勿将config.yaml提交到 Git。4.1 LLM 配置用于生成文案Web 界面提供「快速选择预设」模式从下拉菜单选择预设模型——文档推荐的通义千问性价比高、GPT-4o、DeepSeek以及本地免费的 Ollama系统自动填充base_url与model点击「 获取 API Key」链接注册并获取密钥填入 API Key。从源码结构看预设由 pixelle_video/llm_presets.py 中的LLM_PRESETS列表定义全部预设均兼容 OpenAI SDK 协议除文档列出的模型外还内置了 Claude 与 Moonshot预设名base_urlmodelQwenhttps://dashscope.aliyuncs.com/compatible-mode/v1qwen-maxOpenAIhttps://api.openai.com/v1gpt-4oClaudehttps://api.anthropic.com/v1/claude-sonnet-4-5DeepSeekhttps://api.deepseek.comdeepseek-chatOllamahttp://localhost:11434/v1llama3.2Moonshothttps://api.moonshot.cn/v1moonshot-v1-8k在 config.example.yaml 中LLM 对应的 YAML 片段为llm: api_key: base_url: model: 也可以手动填写这三项。任何兼容 OpenAI SDK 协议的 API 都可以接入。4.2 图像 / 视频生成配置支持两种方式在 Web 界面中选择其一方式一本地部署ComfyUI安装并启动 ComfyUI填写 ComfyUI URL默认http://127.0.0.1:8188点击「测试连接」确认服务可用可选填写 ComfyUI API Key从 Comfy Platform 个人中心获取。方式二云端部署RunningHub无需本地 GPU注册 RunningHub 账号并获取 API Key在配置中填写 API Key配置高级选项并发限制设置同时执行的任务数1-10普通会员默认为 1实例类型选择 24GB 或 48GB 显存机器48GB 适合大尺寸视频生成。对应的配置片段config.example.yamlcomfyui: comfyui_url: http://127.0.0.1:8188 comfyui_api_key: runninghub_api_key: runninghub_concurrent_limit: 1 tts: default_workflow: selfhost/tts_edge.json image: default_workflow: runninghub/image_flux.json prompt_prefix: Minimalist black-and-white matchstick figure style illustration, clean lines, simple sketch style video: default_workflow: runninghub/video_wan2.1_fusionx.json prompt_prefix: Minimalist black-and-white matchstick figure style illustration, clean lines, simple sketch style从该模板可以看出几个关键设计工作流按来源分目录runninghub/目录存放云端工作流无需本地环境selfhost/目录存放本地 ComfyUI 工作流。仓库中 workflows/selfhost 已内置tts_edge.json、tts_index2.json、image_flux.json、image_qwen.json、video_wan2.1_fusionx.json、analyse_image.json、analyse_video.json等workflows/runninghub 则内置了 image_flux、image_qwen、video_wan2.2、tts_edge、tts_spark 等更丰富的云端工作流prompt_prefix提示词前缀统一控制配图/视频的整体风格需使用英文例如黑白简笔画火柴人风格Docker 用户注意配置文件注释提示容器内访问宿主机 ComfyUI 时Mac/Windows 应使用host.docker.internal:8188Linux 应使用宿主机 IP。4.3 直连 API 媒体模型配置可选如果不想依赖 ComfyUI/RunningHub 工作流还可以在api_providers段直连模型供应商的官方 APIapi_providers: openai: api_key: base_url: https://api.openai.com/v1 use_proxy: false dashscope: api_key: base_url: https://dashscope.aliyuncs.com/api/v1 use_proxy: false ark: api_key: base_url: https://ark.cn-beijing.volces.com/api/v3 use_proxy: false kling: base_url: https://api-beijing.klingai.com access_key: secret_key: use_proxy: false支持的供应商涵盖 OpenAI/GPT Image、DashScope/通义万象、火山方舟 ARK/Seedream/Seedance、可灵 Kling 等。每项可配置 API Key、Base URL、是否走本地代理等print_model_input可开启调试模式在终端打印发送给模型的 prompt 与输入文件路径。对应实现位于 pixelle_video/services/api_services其中已内置 image_dashscope、image_gpt、image_seedream、video_kling、video_seedance、vlm_dashscope 等具体供应商客户端。提示如果只使用 ComfyUI 或 RunningHub可以完全不填 API 媒体模型配置只有选择api/...类工作流时才需要配置对应供应商密钥。4.4 模板配置template段用于配置默认视频模板模板决定了视频的画幅比例与版式风格config.example.yamltemplate: default_template: 1080x1920/image_default.html模板命名遵循约定static_*.html为纯静态样式模板无需 AI 生成媒体、image_*.html为图片模板用 AI 配图作背景、video_*.html为视频模板用 AI 视频作背景。仓库 templates 目录下已按 1080x1920、1080x1080、1920x1080 三个尺寸分组提供 20 套模板如竖屏的 image_default、image_modern、image_elegant方形的 image_minimal_framed横屏的 image_film、image_full 等。4.5 保存配置填写完所有必需配置后点击「保存配置」配置会写入config.yaml。从 pixelle_video/config/loader.py 的源码看加载器使用yaml.safe_load读取配置文件若文件不存在则回退到默认配置并打印告警保存时使用yaml.dump写出allow_unicodeTrue。全局配置管理器为单例config_managerpixelle_video/service.py 中的PixelleVideoCore在创建 ComfyKit 实例时会以 MD5 哈希检测配置变化配置变更后自动重建实例实现 Web 界面内的热更新。五、费用说明三种运行方案文档首页明确给出了三种费用方案核心结论是完全支持免费运行方案LLM图像/视频费用完全免费方案Ollama本地运行ComfyUI 本地部署0 元推荐方案通义千问生成一个 3 段视频约 0.01-0.05 元ComfyUI 本地部署极低云端方案OpenAIRunningHub 云端较高但无需本地环境选择建议本地有显卡优先选择完全免费方案否则推荐通义千问性价比高。六、生成第一个视频五步实战流程安装配置完成后参照 快速开始 即可产出第一个视频。步骤一启动 Web 界面整合包用户双击start.bat浏览器自动打开http://localhost:8501源码用户uv run streamlit run web/app.py。步骤二检查配置首次使用展开「⚙️ 系统配置」面板确认已配置 LLM模型 API Key与图像服务ComfyUI 地址或 RunningHub API Key点击「保存配置」。步骤三输入主题在左侧栏「 内容输入」区域选择「AI 生成内容」模式输入一个主题例如为什么要养成阅读习惯可选设置场景数量默认 5 个分镜。主题示例为什么要养成阅读习惯 / 如何提高工作效率 / 健康饮食的重要性 / 旅行的意义。扩展左侧栏还支持「固定文案内容」模式直接粘贴现成文案跳过 AI 创作适合已有脚本的场景BGM 可选择无 BGM、内置音乐或将 MP3/WAV 文件放入仓库的 bgm 文件夹作为自定义音乐并支持试听。步骤四配置语音和视觉语音设置选择 TTS 工作流默认 Edge-TTS 即可如需声音克隆上传参考音频MP3/WAV/FLAC 等适用于 Index-TTS 等支持克隆的工作流可输入测试文本点击「预览语音」试听效果。视觉设置选择图像生成工作流默认即可设置图像尺寸默认 1024x1024选择视频模板推荐竖屏 1080x1920。扩展图像工作流支持本地 selfhost、云端 runninghub 以及api/...直连模型三类系统会自动扫描 workflows 文件夹中的 JSON 工作流Prompt Prefix 用于控制整体风格点击「预览风格」可测试。视频模板按尺寸分组显示支持点击「预览模板」自定义参数测试。步骤五生成并预览视频点击右侧栏「 生成视频」按钮系统显示实时进度生成文案 → 生成配图每个分镜→ 合成语音 → 合成视频。生成一个 5 分镜视频约需 2-5 分钟耗时取决于 LLM API 响应速度、图像生成速度、TTS 工作流类型与网络状况。生成完成后右侧自动播放预览展示视频时长、文件大小、分镜数量与视频尺寸等元信息视频文件保存在output/文件夹中。七、背后的模块化架构能力如何被编排Pixelle-Video 不只是「一个页面」其核心是一个分层清晰的服务层。根据 pixelle_video/service.py 源码PixelleVideoCore的架构可概括为PixelleVideoCore ├── config # 全局配置管理器config_manager 单例 ├── llm # LLM 服务直连 OpenAI SDK 兼容接口 ├── tts # TTS 服务通过 ComfyKit 调用工作流 ├── media # 媒体服务ComfyKit 工作流支持图像与视频 ├── api_media # 直连 API 媒体服务DashScope/OpenAI/ARK/Kling 等 ├── video # 视频合成服务 ├── frame_processor # 帧/画面处理器 ├── persistence # 输出持久化默认 output 目录 ├── history # 历史记录管理 └── pipelines # 视频生成流水线 ├── standard # 标准流程 ├── custom # 自定义流程 └── asset_based # 素材驱动流程上传照片/视频自动生成脚本核心亮点有两处ComfyKit 懒加载 配置热更新ComfyKit 实例在首次使用时才创建并通过配置哈希检测自动重建见 pixelle_video/service.py 的_get_or_create_comfykit方法因此修改配置无需重启进程流水线可插拔initialize()中注册了 standard、custom、asset_based 三条流水线pixelle_video/pipelines后续可继续扩展。Web 端 web/pipelines 进一步提供了 standard、i2v图生视频、digital_human数字人口播、action_transfer动作迁移、asset_based 等多个 UI 流水线并在首页以 Tab 形式呈现见 web/pages/1__Home.py。各条流水线遵循大致相同的阶段化执行模型。以 pixelle_video/pipelines/standard.py 为例其公开方法依次对应setup_environment环境准备→generate_content生成文案→determine_title确定标题→plan_visuals规划画面/图像提示词→initialize_storyboard初始化分镜→produce_assets逐帧生成素材含信号量并发控制→post_production后期合成→finalize产出结果。这一链条与 Web 界面展示的「生成文案 → 生成配图 → 合成语音 → 合成视频」进度一一对应也从实现层面印证了文档对生成流程的描述。编程接口示例除 Web 界面外PixelleVideoCore也提供 Python 异步接口官方 docstring 给出如下用法from pixelle_video import pixelle_video # 初始化 await pixelle_video.initialize() # 直接调用能力 answer await pixelle_video.llm(Explain atomic habits) audio await pixelle_video.tts(Hello world) media await pixelle_video.media(prompta cat) # 生成视频可选 pipelinestandard / custom / asset_based result await pixelle_video.generate_video( text如何提高学习效率, n_scenes5, )八、常见问题与后续探索Q第一次使用需要多久A取决于分镜数量、网络状况与 AI 推理速度通常几分钟内完成。Q视频效果不满意怎么办A可依次尝试更换 LLM 模型不同模型文案风格不同→ 调整图像尺寸与提示词前缀改变配图风格→ 更换 TTS 工作流或上传参考音频改变语音效果→ 尝试不同视频模板与尺寸。Q费用大概多少A完全免费方案Ollama 本地 ComfyUI为 0 元推荐方案通义千问 本地 ComfyUI成本极低云端方案OpenAI RunningHub费用较高但无需本地环境。生成第一个视频后可以继续深入以下方向调整视觉风格阅读 自定义视觉风格教程结合 模板开发指南 打造专属模板克隆声音阅读 使用参考音频克隆声音教程使用 API阅读 API 使用指南 与 API 总览理解架构阅读 架构文档排查问题查阅 故障排查 与 FAQ。项目采用 Apache 2.0 许可证见 LICENSE文档站点的完整中文手册从 docs/zh 目录可继续浏览。【免费下载链接】Pixelle-Video AI 全自动短视频引擎 | AI Fully Automated Short Video Engine项目地址: https://gitcode.com/GitHub_Trending/pi/Pixelle-Video创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表