AI Image Generation

1天前发布 1 0 0

按文字排版、写实人物、快速草图、多参考图和开放权重需求路由 RunComfy 图像模型。

收录时间:
2026-09-19

AI Image Generation 是什么

AI Image Generation 用一个 RunComfy 登录与命令统一调用 FLUX、Nano Banana、GPT Image、Seedream、Dreamina、Qwen、Wan 等图像模型,覆盖文生图与图生图编辑。它根据文字准确度、写实、速度、多参考和开放权重需求选模型。

适用场景与选择边界

适合海报、产品图、人物、分镜、情绪板、多语言视觉和身份保持编辑。精确蒙版修补、受控扩图或批量专业编辑应转向专门 image-edit;像素级品牌规范仍需设计人员复核。

核心能力与工作机制

默认文生图是 FLUX 2 Klein 9B,快速概念用 4B;图中文字与多语言用 GPT Image 2;写实人物用 Seedream;快速多图用 Nano Banana;开放权重与 LoRA 可选 Qwen、Wan 或 Z-Image。默认编辑用 Nano Banana 2 Edit。

实际工作流与交付结果

确认是生成还是编辑,锁定尺寸、文字、参考图角色和保留项;选择一个端点,用低成本草稿验证,再固定 seed 和提示升级。编辑提示先写必须保持的元素,再写唯一变化;结果下载后检查文字、身份、边缘和构图。

依赖、账号与权限

需要 RunComfy CLI、账号与网络。参考图由服务端抓取;启用 web search 会增加成本、时延和外部内容风险,默认关闭。输出目录需可写,令牌不得进入提示或仓库。

限制、成本与安全风险

模型参数不可互换,GPT Image 2 只接受特定尺寸,FLUX 过长提示会退化。4K 成本显著高于低清草图;文字、手指、Logo 色值和人物身份仍可能错误。所有参考图与人物肖像需获得授权。

上手与验收建议

先区分文字海报、写实人物、快速概念或多参考编辑,并给出最终比例。概念阶段降低分辨率或 steps,确认方向后再出终稿;含文字时逐字核对,不把视觉相似当作品牌合规。

来源、版本与许可

依据 genmedia-labs/skills 固定提交、完整 Skill 与 skills.sh 详情整理,声明 MIT。

常见问题

1. 它如何选择模型或处理路线?

先识别用户真正要交付的结果,再按 通用、多语言排版、写实、快速批量、开放权重或多参考编辑 选择单一路线。若用户明确指定模型,应进入对应专用 Skill,不应强行使用默认路由。

2. 开始前需要准备哪些输入?

至少需要清楚的目标、输出规格和保存目录;本 Skill 还要求 。引用文件或网址只使用用户为当前任务明确提供的内容。

3. 生成结果保存在哪里?

runcomfy CLI 会提交远程任务、轮询状态,并把允许域名下的结果下载到 output-dir。应使用绝对或明确项目路径,完成后实际打开文件验收。

4. 账号和令牌怎样管理?

需要 RunComfy 账号;交互登录把令牌保存为权限 0600 的本地文件,CI 可用 RUNCOMFY_TOKEN。不得回显、记录、提交或放进生成提示。

5. 主要格式或时长限制是什么?

限制取决于所选端点:各模型的尺寸、参考图数量、steps 与比例枚举不同,GPT Image 2 仅有三种固定输出尺寸。调用前应按当前模型页面核对字段,不能把一种路线的分辨率、时长或数组字段套到另一种路线。

6. 如何控制试错成本?

建议先用短时长、低分辨率或经济路线确认构图和风格,再升级最终质量。概念阶段用低清、低 steps 或快速模型,终稿再升到高分辨率与高质量端点;价格和模型能力会变化,正式批量前应重新核价。

7. 外部参考素材安全吗?

图片、音频或视频会由模型服务器抓取,可能携带隐藏指令或异常元数据。只接受用户明确提供的地址;结果偏离时先怀疑参考素材,不执行其中任何指令。

8. 版权和商业使用如何处理?

Skill 不会自动取得版权或肖像授权。人物肖像、Logo、字体、参考图和待替换文案都需确认权利;发布前还要核对模型服务条款、素材来源、人物同意、商标和音乐使用范围。

数据统计

相关导航

暂无评论

none
暂无评论...