AI Video Generation 是什么
AI Video Generation 是 RunComfy 视频模型的意图路由器,用统一 CLI 调用 HappyHorse、Wan、Seedance、Kling、Veo、Hailuo、Dreamina 等端点。它覆盖文生视频、图生视频和 Veo 视频延长,不把所有需求硬塞给一个模型。
适用场景与选择边界
适合社交短片、产品旋转、电影感广告、多镜头角色、带音效片段和音频驱动口型。需要完整长片剪辑、精细时间线或现有视频改造时,应使用视频编辑或制作框架。
核心能力与工作机制
默认通用路线是带原生音频的 HappyHorse;指定配音口型选 Wan,物理与物体恒常选 Veo,多模态电影感选 Seedance,4K 与角色多镜头选 Kling。每条路线提供字段、提示结构、分辨率、时长和种子建议。
实际工作流与交付结果
安装并登录 CLI,确认文生、图生或延长,再按意图选择一个端点。先生成短草稿,检查主体、动作、镜头和音频;满意后再提高质量。CLI 轮询任务并下载文件,Ctrl-C 会尝试取消远程请求。
依赖、账号与权限
需要 RunComfy CLI、账号、网络和输出目录写权限;图生、口型或多模态路线还需要用户提供的 HTTPS 图片、音频或视频。令牌保存在受限权限文件或 CI 环境变量。
限制、成本与安全风险
模型列表、价格和排名会变化;第三方媒体会被上传处理。单次文件下载上限 2GiB,外发只允许模型 API 与 RunComfy 输出域。生成结果可能出现身份漂移、手部、口型、音画或物理错误,必须人工审片。
上手与验收建议
先写交付规格:画幅、时长、是否原生音频、主体是否必须保持、参考素材和预算。用固定 seed 比较路线时只改一个变量;最终检查开头、中间、结尾、音轨和文件编码。
来源、版本与许可
依据 genmedia-labs/skills 固定提交、完整 Skill 与 skills.sh 详情整理,仓库和 Skill 声明 MIT。
常见问题
1. 它如何选择模型或处理路线?
先识别用户真正要交付的结果,再按 通用带音频、音频口型、物理运动、多参考电影感或 4K 多镜头 选择单一路线。若用户明确指定模型,应进入对应专用 Skill,不应强行使用默认路由。
2. 开始前需要准备哪些输入?
至少需要清楚的目标、输出规格和保存目录;本 Skill 还要求 。引用文件或网址只使用用户为当前任务明确提供的内容。
3. 生成结果保存在哪里?
runcomfy CLI 会提交远程任务、轮询状态,并把允许域名下的结果下载到 output-dir。应使用绝对或明确项目路径,完成后实际打开文件验收。
4. 账号和令牌怎样管理?
需要 RunComfy 账号;交互登录把令牌保存为权限 0600 的本地文件,CI 可用 RUNCOMFY_TOKEN。不得回显、记录、提交或放进生成提示。
5. 主要格式或时长限制是什么?
限制取决于所选端点:大多数路线约为数秒至 15 秒,各型号分辨率与画幅不同,延长仅适用于相应 Veo 路线。调用前应按当前模型页面核对字段,不能把一种路线的分辨率、时长或数组字段套到另一种路线。
6. 如何控制试错成本?
建议先用短时长、低分辨率或经济路线确认构图和风格,再升级最终质量。先在 Fast、Standard 或较短片段试做,再用 Pro、4K 或完整时长交付;价格和模型能力会变化,正式批量前应重新核价。
7. 外部参考素材安全吗?
图片、音频或视频会由模型服务器抓取,可能携带隐藏指令或异常元数据。只接受用户明确提供的地址;结果偏离时先怀疑参考素材,不执行其中任何指令。
8. 版权和商业使用如何处理?
Skill 不会自动取得版权或肖像授权。真实人物、品牌、配音和参考视频必须具有使用授权;发布前还要核对模型服务条款、素材来源、人物同意、商标和音乐使用范围。