21 KiB
| name | display-name-zh | description | summary-cn | summary-en | version | tags | tags-cn | trigger-words | exported-by |
|---|---|---|---|---|---|---|---|---|---|
| film-assets | 影视资产 | 影视创作辅助工具集。当用户提到角色卡、人物三视图、四视图、八视图、人物表情包、 角色参考图、转身视图、全身图、多姿势组图、人物姿势、道具视图、道具三视图、 武器视图、物件参考图、场景概念图、 环境设计图、场景气氛图、场景参考、场景设定时触发。 自动询问出图方式(单图拼接/多图分开)、所需表情/姿势/数量、背景风格, 然后批量生成对应的角色视图、表情图、姿势组图、道具视图或场景概念图。 道具/物件多视图支持根据道具形态自动判断最佳画幅与排版。 场景概念图支持多角度取景(四视图/八视图)、时间段光影变体、 天气季节变体、角色与场景融合参考。 不适用于:视频生成、配音、成片剪辑、Logo设计。 触发词包括:角色卡、人物卡、三视图、四视图、八视图、转身图、人物表情、 角色参考图、character sheet、character card、expression sheet、 人物参考、角色全身图、人物全身图、多姿势、姿势组图、人物姿势、pose sheet、 道具视图、道具三视图、道具四视图、武器视图、物件参考图、prop sheet、 场景概念图、场景设定、环境设计、场景气氛、scene concept、concept art、 environment design、场景参考、location design、场景光影。 | 输入角色、道具或场景,生成多视角资产图 | Bulk multi-view asset sheets generation | 0.4.1 | [Image Character Film Reference Concept-Art Prop] | [图片 角色 影视 参考 概念图 道具] | [角色卡 人物卡 三视图 四视图 八视图 转身图 人物表情 角色参考图 character sheet character card expression sheet 人物参考 角色全身图 人物全身图 多姿势 姿势组图 人物姿势 pose sheet 道具视图 道具三视图 道具四视图 武器视图 物件参考图 prop sheet 场景概念图 场景设定 环境设计 场景气氛 scene concept concept art environment design 场景参考 location design 场景光影] | MiniMax-hub |
影视资产 Skill — 角色参考图、道具多视图与场景概念图
本 Skill 包含三大模块:
- 模块 A:角色参考图(视图 / 表情 / 姿势 / 角色卡)→ STEP A1–A5
- 模块 B:场景概念图(多角度 / 光影变体 / 天气季节 / 角色融合)→ STEP B1–B5
- 模块 C:道具/物件多视图(自适应画幅 / 摄影机位环绕)→ STEP C1–C5
识别用户意图后,进入对应模块执行。
边界守卫
本 Skill 的能力范围仅限于静态图片资产生成,具体为:
- ✅ 角色多视图 / 表情包 / 姿势组图 / 角色卡
- ✅ 道具/物件多视图(三视图 / 四视图)
- ✅ 场景概念图(多角度 / 光影变体 / 天气季节 / 角色融合)
以下任务不在本 Skill 范围内:
- ❌ 视频生成 / 动画 / 视频剪辑
- ❌ 配音 / 音乐 / 音效
- ❌ Logo / UI / 平面设计
- ❌ 将生成的图片进一步制作为视频或其他非图片产物
触发时机:当以下任一条件满足时,在执行前向用户发出提示并等待确认:
- 当前模块的所有 STEP 已执行完毕,用户的下一条指令不属于本 Skill 三个模块中的任何一个
- 用户指令明确涉及上述 ❌ 列表中的任务
- 用户指令与本 Skill 无关(如写代码、查资料、闲聊等)
提示模板:
「影视资产」Skill 的任务已完成。该 Skill 仅包含角色参考图、道具多视图、场景概念图的生成步骤,不包含 [用户要求的能力,如视频生成/配音/剪辑等] 步骤。接下来的操作将不受该 Skill 约束,是否继续?
⏸ 等待用户确认后再继续执行后续指令。
模块 A:角色参考图
涵盖三视图、四视图、八视图(转身图)、角色卡、表情包、多姿势组图。
STEP A1:判断子类型并询问配置
根据用户描述判断子类型,并用 Q&A 组件一次性收集必要配置:
| 用户提到 | 子类型 | 需要询问 |
|---|---|---|
| 三视图 | 视图 | 出图方式 |
| 四视图 | 视图 | 出图方式 |
| 八视图 / 转身图 | 视图 | 出图方式 |
| 角色卡 | 角色卡 | (固定布局,无需额外配置) |
| 表情 / 表情包 | 表情 | 出图方式 + 所需表情 |
| 多姿势 / 姿势组图 / pose sheet | 姿势 | 出图方式 + 姿势数量 + 姿势风格 |
出图方式(视图/表情/姿势共用):
- 单图模式:所有视角/表情/姿势拼合在一张图里(推荐,适合参考用)
- 多图模式:每个视角/表情/姿势单独生成一张图(适合逐张调整)
表情选项(仅表情子类型时询问,可多选): 冷漠/微笑/轻蔑/愤怒/惊讶/开心大笑/若有所思/悲伤/害羞
姿势配置(仅姿势子类型时询问):
- 数量:4 个(2×2)/ 6 个(2×3)/ 9 个(3×3,推荐)
- 风格:根据角色形象智能推荐(见 STEP A3)
背景风格:
- 纯色背景(白/浅灰)—— 推荐
- 简约线条装饰
- 专业摄影棚灰背景
⏸ 等待用户回答后再继续。
STEP A2:视图角度定义
全局视角约束: 平视角度(eye-level straight-on shot),相机高度与人物腰部至胸部齐平,禁止俯拍或仰拍。 人物比例正常(normal human proportions),头身比与真实人体一致,禁止夸张拉伸或缩小。
三视图(1×3 横排)
正面全身 → 侧面全身 → 背面全身
四视图(1×4 横排)
正面全身 → 侧面全身(90°) → 镜头绕到另一个不同的侧面(90°) → 背面全身
侧面提示词规范(关键):
- 第二格描述为 "Side Profile View",不指定左右方向
- 第三格描述为 "The lens orbits to another different side of the character, showing a completely different side profile",用摄影机运动语言描述空间位移
- 禁止使用 left / right / 左 / 右 / mirror / 镜像 等对称方向词
- 原理:AI 模型对"左/右"对称语义理解较弱,容易生成镜像翻转的相同画面;使用摄影机物理移动的动态描述,能生成真正不同角度的侧面
八视图(2×4 网格,模拟 360° 转身)
| 序号 | 视角 | 说明 |
|---|---|---|
| 1 | 正面 | 完全面向观察者 |
| 2 | 右45° | 略偏右的正面 |
| 3 | 右90° | 角色右侧面 |
| 4 | 右135° | 接近背面,可见右侧后背 |
| 5 | 背面 | 完全背向观察者 |
| 6 | 左135° | 接近背面,可见左侧后背 |
| 7 | 左90° | 角色左侧面 |
| 8 | 左45° | 略偏左的正面 |
八视图要求角色身份(面孔、服装、发型、发色)在所有 8 张中高度一致。
角色卡(固定布局)
横版 16:9 单图,深灰纯色背景,无地面线,无装饰元素:
- 左侧(约1/3):全身正面站立姿势
- 竖向黑色分割线
- 右侧(约2/3):3 个头部特写横向排列(正脸 / 一侧脸 / 另一侧脸)
提示词中不使用"左/右"描述面部朝向,用"one side"/"the other side"替代。 不添加任何文字标签。
STEP A3:子类型专属规范
表情图
- 单图模式:≤7 种用 4+3 网格,≥8 种用 4+4 或三行布局
- 每个面板为胸像(头部 + 肩部),纯色背景
- 在提示词中描述每种表情的肌肉状态(眉形、眼型、嘴角方向)
- 角色基础外貌在所有表情中保持一致
姿势组图
先分析角色形象,智能推荐姿势风格(将最匹配的排在首位标注「推荐」):
| 人物特征 | 推荐风格 | 典型动作 |
|---|---|---|
| 西装/正装 | 职场正式感 | 站姿、叉腰、手持文件、背手直立 |
| 运动装 | 运动动态 | 起跑、跳跃、拉伸、运球 |
| 休闲装 | 生活随拍感 | 插兜、靠墙、坐台阶、回眸 |
| 汉服/古装 | 古典仪态 | 拱手、持扇、回眸、提裙 |
| 制服 | 职业场景感 | 敬礼、执行任务、操作工具 |
| 礼服 | 优雅仪态 | 裙摆展示、侧身回头、持花 |
| 校服 | 青春活力 | 背书包、跑步、课间互动 |
姿势提示词需描述:动作起始状态、手的位置、头部朝向、重心偏向、气质关键词(powerful/elegant/candid/dynamic)。
STEP A4:生成参数规范
| 参数 | 规范 |
|---|---|
| 模型限制 | 仅允许使用 Banana 和 image2,禁止回退到其他模型 |
| 风格 | 与角色来源图保持一致(写实/动漫/3D),未指定则默认写实 |
| 光线 | 柔和摄影棚光(soft studio lighting) |
| 画质修饰 | 8K, sharp focus, high detail |
| 文字标签 | 不添加任何文字标签 |
| 角色一致性 | 每次调用都重复完整外貌描述(子 agent 无状态) |
| 参考图 | 用户提供了参考图/原图时,必须将文件路径传给 image agent |
| 批量策略 | 同类资源一次性批量生成 |
| 比例 | 单图模式:统一 16:9;多图模式:每张 2:3 或 1:1 |
| 背景 | 角色卡默认深灰纯色;其他子类型默认纯白;用户指定时按用户要求 |
艺术风格锁定(根据来源图判断):
- 写实类:
Medium: hyper-realistic photography. NOT anime, NOT cartoon, NOT 3D render. - 动漫类:
Medium: 2D anime illustration style. NOT photoreal, NOT 3D render. - 3D 类:
Medium: stylized 3D render. NOT photoreal, NOT anime.
STEP A5:呈现与扩展
展示所有生成图,说明每张图对应的视角/表情/姿势,提示用户可指定重新生成或调整。
可选扩展:加表情变体 / 换服装 / 导出单张高清大图。
模块 B:场景概念图(Scene Concept Art)
用于影视前期美术阶段,生成场景/环境的视觉参考图。
STEP B1:获取场景来源
询问用户是否有现成的场景参考图:
- 有参考图 → 后续基于参考图生成变体
- 无参考图 → 用户文字描述场景(地点类型、空间风格、年代感、关键物件、情绪基调),从头生成
⏸ 等待用户提供参考图或文字描述。
STEP B2:询问功能需求与出图方式
功能需求(可多选):
- 多角度取景 — 同一场景从不同正交角度展示(四视图 / 八视图)
- 时间段光影变体 — 同一场景在不同时段的光影效果
- 天气/季节变体 — 同一场景在不同天气或季节下的氛围变化
- 角色-场景融合 — 将指定角色放入场景中
出图方式: 单图拼合(推荐) / 多图独立 艺术风格: 有参考图时直接继承,无参考图时询问。
⏸ 等待用户确认。
STEP B3:各功能生成规范
多角度取景
模型不理解 3D 空间旋转,用 ON SCREEN 描述法代替角度数字。
四条核心规则:
- 用物体命名墙壁,不用方向 — 为每面墙找一个独一无二的标志性物体作为名称(如
Wall A (the vent-grate wall)),禁止用左墙/右墙。 - ON SCREEN 描述法 — 逐面板写明每个关键物体出现在画面的哪一侧、近景还是远景、完整还是裁切。
- "另一侧"不是镜像 — 相机移到对面墙时,物体近远关系翻转,必须显式说明。禁止 MIRROR/镜像。
- LAYOUT LOCK — prompt 中必须包含布局锁定声明:所有面板的物体位置冻结,只有相机位置变化。在面板描述前写详细版,尾部简要重申。
八视图面板模板(2×4 网格): 正面 → 一侧 → 另一侧 → 背面 → 对角线甲 → 对角线乙 → 俯视 → 仰视。四视图取前 4 个。
时间段光影变体
| 时段 | 光影描述 |
|---|---|
| 黎明 | 暖橙光,长影子,薄雾感,3000K |
| 正午 | 强顶光,短硬阴影,高对比,5500K |
| 黄昏 | 金色侧光,长暖影,天空橙紫渐变,2500K |
| 夜晚 | 月光冷蓝调,人工暖光点缀,高光比,7000K+ |
天气/季节变体
| 天气 | 关键词 |
|---|---|
| 晴天 | clear sky, sharp shadows, vivid colors |
| 雨天 | wet surfaces, reflections, rain streaks, puddles |
| 雪天 | snow-covered, muted palette, cold breath vapor |
| 雾天 | thick fog, low visibility, silhouettes, desaturated |
角色-场景融合
传递角色参考图 + 完整外貌描述,明确位置/姿势/动作,环境占 60-70%,角色占 30-40%。
STEP B4:生成参数规范
| 参数 | 规范 |
|---|---|
| 模型限制 | 仅允许使用 Banana 和 image2,禁止回退到其他模型 |
| 风格 | 有参考图时直接继承,无参考图时根据用户选择锁定 |
| 比例 | 单图拼合:1:1;多图独立:16:9 |
| 文字标签 | 不添加 |
| 场景一致性 | 所有变体中空间结构、物件位置保持一致 |
| 画质修饰 | 8K, sharp focus, high detail |
艺术风格锁定:
- 写实电影感(默认):
Medium: cinematic realistic concept art, photorealistic lighting. NOT anime, NOT cartoon, NOT 3D render. - 手绘概念风:
Medium: digital matte painting, concept art illustration. NOT photoreal, NOT anime. - 动漫场景:
Medium: 2D anime background illustration. NOT photoreal, NOT 3D render.
STEP B5:呈现与扩展
展示生成图,提示用户可追加光影/天气变体、加入角色、导出单张高清、生成姊妹场景。
模块 C:道具/物件多视图
当生成对象为道具、武器、载具、物件等非人物主体时,进入本模块。 与角色视图(正交平视)不同,道具视图采用摄影机位环绕拍摄效果,每面板是一个带透视的实拍角度。
STEP C1:获取道具来源并询问配置
询问用户是否有道具参考图:
- 有参考图 → 用
read_media分析参考图,提取逐部件精确特征 - 无参考图 → 用户文字描述道具外观
询问配置:
- 视图类型:三视图 / 四视图
- 出图方式:单图模式(推荐)/ 多图模式
- 背景:纯白(推荐)/ 浅灰 / 摄影棚灰
⏸ 等待用户回答后再继续。
STEP C2:分析道具形态并自适应画幅
使用 read_media 分析参考图,提取主体的长宽厚比例与主要展开方向,按下表选择排版。
| 道具形态 | 推荐排版 | 整图比例 |
|---|---|---|
| 横向扁平型(宽 >> 高,如箱体、长枪、车辆) | N行×1列 竖排 | 1:1 或 3:4 |
| 纵向细长型(高 >> 宽,如剑、权杖、立柱) | 1行×N列 横排 | 16:9 |
| 接近等比型(宽 ≈ 高,如头盔、球体、方盒) | 三视图 1×3 横排,四视图 2×2 网格 | 16:9 / 1:1 |
| 复杂异形(多方向伸展,如带线缆/翅膀/支架) | 三视图 1×3 横排,四视图 2×2 网格 | 16:9 / 1:1 |
核心原则:道具一致性优先于排版美观。保证每个视角有足够空间精确还原所有部件。
STEP C3:道具视图角度定义
全局视角约束: 采用摄影机位环绕拍摄效果,不是工程制图式的正交投影。 每个面板像摄影师在该位置实际拍摄的照片:有自然透视(近大远小)、真实光影和地面柔和阴影。 道具始终保持正常放置状态,绝对不能翻转、竖立或旋转。 道具比例正常(accurate real-world proportions),禁止夸张拉伸或缩小。
道具三视图
摄影机在道具周围三个机位拍摄:
| 面板 | 机位 | 描述 |
|---|---|---|
| 1 | 前方 3/4 视角 | 摄影机在道具前方偏侧,略微俯视(约 30°),同时看到顶部、正面和一个侧面 |
| 2 | 正侧面视角 | 摄影机在道具正侧面,平视或微微俯视,展示道具完整的侧面轮廓 |
| 3 | 后方 3/4 视角 | 摄影机绕到道具后方偏侧,略微俯视,同时看到顶部、背面和另一个侧面 |
道具四视图
摄影机在道具周围四个机位拍摄,形成 360° 环绕:
| 面板 | 机位 | 描述 |
|---|---|---|
| 1 | 前方 3/4 视角 | 摄影机在道具前方偏侧,略微俯视(约 30°),同时看到顶部、正面和一个侧面 |
| 2 | 侧面视角 | 摄影机在道具一个侧面,平视或微微俯视,展示完整侧面轮廓 |
| 3 | 后方 3/4 视角 | 摄影机绕到道具后方偏侧,略微俯视,同时看到顶部、背面和另一个侧面 |
| 4 | 对侧面视角 | 摄影机绕到面板 2 的对面,展示与面板 2 相对的另一个侧面 |
侧面提示词规范:
- 面板 2 描述为 "Side view, the camera is positioned at one side of the prop"
- 面板 4 描述为 "The camera orbits to the opposite side from panel 2, showing the other side of the prop"
- 禁止使用 left / right / 左 / 右 / mirror / 镜像 等对称方向词
STEP C4:道具一致性与生成参数
一致性强约束
- 参考图是唯一视觉真理:prompt 中强调以参考图为绝对锚点,所有部件的形状、位置、材质、颜色必须完全匹配
- 逐部件精确描述:逐一列出每个部件的特征(形状、材质、颜色、位置、数量),不可笼统概括
- 一致性增强词必须写入 prompt:
same product shape as reference image, identical silhouette, exact color reproduction, same material texture, identical surface finish, no design modifications, identical product details across all views - Negative prompt 必须精准取反:根据 read_media 分析结果,把道具的关键特征取反写入 negative,防止模型自由发挥
- 面板数量强约束:模型对体积大或结构复杂的道具容易自行增加面板数量(如三视图生成 6 个画面)。必须在 prompt 中用多重方式锁定数量:
- 正向声明:
exactly N panels, each panel contains exactly ONE instance of the prop - 反向禁止:
NOT more than N, NOT N+1, NOT N+2, NOT N+3 - 兜底警告:
If you generate more than N instances the entire image is WRONG - Negative prompt 追加:
more than N items, extra panels, duplicate views, extra rows
- 正向声明:
生成参数
| 参数 | 规范 |
|---|---|
| 模型限制 | 仅允许使用 Banana 和 image2,禁止回退到其他模型 |
| 风格 | 与道具来源图保持一致,未指定则默认写实 |
| 光线 | 柔和摄影棚光(soft studio lighting),每面板有地面柔和阴影 |
| 画质修饰 | 8K, sharp focus, high detail |
| 文字标签 | 不添加任何文字标签 |
| 参考图 | 必须将文件路径传给 image agent |
| 批量策略 | 同类资源一次性批量生成 |
| 比例 | 按 STEP C2 自适应画幅判断 |
| 背景 | 默认纯白;用户指定时按用户要求 |
艺术风格锁定:
- 写实类(默认):
Medium: hyper-realistic product photography, studio lighting with natural perspective. NOT anime, NOT cartoon, NOT illustration, NOT orthographic engineering drawing. - 动漫类:
Medium: 2D anime illustration style. NOT photoreal, NOT 3D render.
STEP C5:呈现与扩展
展示生成图,说明每张图对应的机位角度,提示用户可指定重新生成或调整。
可选扩展:追加更多角度 / 换材质或配色 / 导出单张高清大图 / 生成道具在场景中的放置效果。
快速参考
模块 A — 角色:
三视图:正面 → 侧面 → 背面(1×3,16:9)
四视图:正面 → 侧面 → 绕到另一侧 → 背面(1×4,16:9)
八视图:8 个角度 360° 转身(2×4)
姿势:4→2×2 | 6→2×3 | 9→3×3
全局约束:平视 eye-level,正常人物比例
模型:仅 Banana / image2
模块 B — 场景:
核心:模型不理解3D旋转 → ON SCREEN 描述法 + LAYOUT LOCK
命名:用物体命名墙壁,不用左右/角度数字
四视图:正面 → 一侧 → 另一侧(近远翻转)→ 背面反打
功能:多角度取景 | 光影变体 | 天气/季节 | 角色融合
模型:仅 Banana / image2
模块 C — 道具:
核心:先分析形态 → 自适应画幅排版
视角:摄影机位环绕拍摄(非正交工程图),每面板有透视感和地面阴影
三视图:前方3/4 → 正侧面 → 后方3/4
横向扁平型:3×1 竖排(1:1 / 3:4)
纵向细长型:1×3 横排(16:9)
等比 / 异形:1×3 横排(16:9)
四视图:前方3/4 → 侧面 → 后方3/4 → 对侧面(面板2的对面)
横向扁平型:4×1 竖排(3:4)
纵向细长型:1×4 横排(16:9)
等比 / 异形:2×2 网格(1:1)
一致性:参考图为唯一真理 + 逐部件描述 + negative 精准取反 + 面板数量强约束
模型:仅 Banana / image2