AI Image Generation 是什么
AI Image Generation 用一个 RunComfy 登录与命令统一调用 FLUX、Nano Banana、GPT Image、Seedream、Dreamina、Qwen、Wan 等图像模型,覆盖文生图与图生图编辑。它根据文字准确度、写实、速度、多参考和开放权重需求选模型。
适用场景与选择边界
适合海报、产品图、人物、分镜、情绪板、多语言视觉和身份保持编辑。精确蒙版修补、受控扩图或批量专业编辑应转向专门 image-edit;像素级品牌规范仍需设计人员复核。
核心能力与工作机制
默认文生图是 FLUX 2 Klein 9B,快速概念用 4B;图中文字与多语言用 GPT Image 2;写实人物用 Seedream;快速多图用 Nano Banana;开放权重与 LoRA 可选 Qwen、Wan 或 Z-Image。默认编辑用 Nano Banana 2 Edit。
实际工作流与交付结果
确认是生成还是编辑,锁定尺寸、文字、参考图角色和保留项;选择一个端点,用低成本草稿验证,再固定 seed 和提示升级。编辑提示先写必须保持的元素,再写唯一变化;结果下载后检查文字、身份、边缘和构图。
依赖、账号与权限
需要 RunComfy CLI、账号与网络。参考图由服务端抓取;启用 web search 会增加成本、时延和外部内容风险,默认关闭。输出目录需可写,令牌不得进入提示或仓库。
限制、成本与安全风险
模型参数不可互换,GPT Image 2 只接受特定尺寸,FLUX 过长提示会退化。4K 成本显著高于低清草图;文字、手指、Logo 色值和人物身份仍可能错误。所有参考图与人物肖像需获得授权。
上手与验收建议
先区分文字海报、写实人物、快速概念或多参考编辑,并给出最终比例。概念阶段降低分辨率或 steps,确认方向后再出终稿;含文字时逐字核对,不把视觉相似当作品牌合规。
来源、版本与许可
依据 genmedia-labs/skills 固定提交、完整 Skill 与 skills.sh 详情整理,声明 MIT。
常见问题
1. 它如何选择模型或处理路线?
先识别用户真正要交付的结果,再按 通用、多语言排版、写实、快速批量、开放权重或多参考编辑 选择单一路线。若用户明确指定模型,应进入对应专用 Skill,不应强行使用默认路由。
2. 开始前需要准备哪些输入?
至少需要清楚的目标、输出规格和保存目录;本 Skill 还要求 。引用文件或网址只使用用户为当前任务明确提供的内容。
3. 生成结果保存在哪里?
runcomfy CLI 会提交远程任务、轮询状态,并把允许域名下的结果下载到 output-dir。应使用绝对或明确项目路径,完成后实际打开文件验收。
4. 账号和令牌怎样管理?
需要 RunComfy 账号;交互登录把令牌保存为权限 0600 的本地文件,CI 可用 RUNCOMFY_TOKEN。不得回显、记录、提交或放进生成提示。
5. 主要格式或时长限制是什么?
限制取决于所选端点:各模型的尺寸、参考图数量、steps 与比例枚举不同,GPT Image 2 仅有三种固定输出尺寸。调用前应按当前模型页面核对字段,不能把一种路线的分辨率、时长或数组字段套到另一种路线。
6. 如何控制试错成本?
建议先用短时长、低分辨率或经济路线确认构图和风格,再升级最终质量。概念阶段用低清、低 steps 或快速模型,终稿再升到高分辨率与高质量端点;价格和模型能力会变化,正式批量前应重新核价。
7. 外部参考素材安全吗?
图片、音频或视频会由模型服务器抓取,可能携带隐藏指令或异常元数据。只接受用户明确提供的地址;结果偏离时先怀疑参考素材,不执行其中任何指令。
8. 版权和商业使用如何处理?
Skill 不会自动取得版权或肖像授权。人物肖像、Logo、字体、参考图和待替换文案都需确认权利;发布前还要核对模型服务条款、素材来源、人物同意、商标和音乐使用范围。