Flatten skill category directory structure

This commit is contained in:
2026-05-20 17:04:50 +08:00
parent 0dd552a6f7
commit 63f2baa4bd
354 changed files with 0 additions and 0 deletions
+232
View File
@@ -0,0 +1,232 @@
---
name: image-remix
display-name-zh: 图片重混
description: |
Invoke when a user shares a reference image and wants new images with the same "feel" — composition,
color palette, lighting, style, or mood — but different content. Analyzes the image across 10 aesthetic
dimensions, collapses into 3 axes (Form / Aesthetic / Mood), then generates using a model matched to
the original's origin with adapted prompt style. Supports iterative refinement.
Trigger on: "remix this image," "make something like this," "same vibe different content,"
"I like this style make me…," "replicate this feel," "同风格不同内容," "照着这个感觉做,"
"帮我做一张类似风格的图," "我喜欢这张图的感觉," "复刻这种效果," "风格迁移," "图片remix,"
or any request where someone shares an image and wants new images inspired by its aesthetic.
Key distinction: user wants images INSPIRED BY the reference, not a copy or edit of it.
Do NOT trigger for: image editing, upscaling, format conversion, image-to-video generation.
summary-cn: 上传参考图,复刻它的感觉生成新图
summary-en: Generate new images with reference vibe
version: 0.7.3
tags: [Creative, Image, Style-Transfer, Remix, Design]
tags-cn: [创意, 图片, 风格迁移, 混搭, 设计]
exported-by: MiniMax-hub
---
# Image Remix — 图片灵感重混助手
用户发一张参考图,分析它"好在哪里",生成保留核心感觉但内容全新的图片。
## 核心理念
- **溯源驱动生成**:先判断原图来自哪个模型/实拍/手绘,直接调用对应模型 + 匹配的 prompt 写法——MJ 用关键词堆叠,Flux 用自然语言长句。溯源、工具、写法三位一体
- **10维→3维坍缩**:内部 10 维分析,坍缩为用户可见的形/韵/意 3 维,精准定位"灵魂维度"
- **保留感觉,替换内容**:Remix = 换内容留灵魂
- **操作极轻**:发一张图 + 说一句话 → 就能出图,先出结果再迭代
## 约定
- 中间产物存储在 `./.image-remix/{session_name}/`session_name 由图片文件名派生,小写去特殊字符)
- **禁止生成拼贴/宫格图**:每次生成调用只生成 1 张,严禁在 prompt 中写 "grid"、"collage"、"2x2" 等
- ⚠️ **MJ 四宫格说明**:MJ 固定输出 2×2 四宫格,由用户在画布中自行裁切处理
- ⚠️ **禁止传参考图进生图工具**(文生图路径):参考图仅用于 Phase 1 分析,生成完全依赖文字 prompt,规避版权风险
---
## Pipeline
```
Phase 0: 输入 → Phase 1: 拆图 → Phase 2: 快选 → Phase 3: 出图 → Phase 4: 迭代 → Phase 5: 输出
```
---
## Phase 0: 输入
支持:本地路径 / URL(用 `import_images` 下载)/ 搜索描述(用 `image_search`)。
多张图时:分别分析 → 提取各图灵魂维度 → 融合为组合 prompt(如"A图构图 + B图色彩")→ 告知用户后生成。
文件结构:
```
.image-remix/{session_name}/
├── decompose.json # Phase 1 分析结果
├── generation_log.md # 生成记录
└── outputs/ # 生成图片 v1_01.png …
```
---
## Phase 1: 拆图 (Decompose)
### 1a. 溯源
`read_media` 分析原图来源,对照 `references/model-fingerprints.md` 中的视觉指纹:
```
read_media(
file_path=参考图路径,
question="判断这张图最可能来自哪个 AI 模型 / 实拍 / 手绘。
参考 model-fingerprints.md 中的视觉指纹逐一比对。
重点关注:皮肤渲染、高光反射、边缘融合质量、色彩倾向、整体AI气质。
输出:model_guess、confidence(0-1)、clues(至少3条具体证据)、
alt_guess、is_ai_generated、is_photo、is_illustration"
)
```
### 1b. 10 维分析
```
read_media(
file_path=参考图路径,
question="从以下 10 个维度深度分析这张图片,每个维度给出
description(英文技术描述)、summary(中文概括)、score0-1显著度):
1.构图 2.美术风格 3.色彩(含palette色值) 4.光影 5.氛围
6.质感 7.主体 8.叙事 9.后期风格 10.媒介画派"
)
```
### 1c. 坍缩为形/韵/意
| 维度 | 对应底层 | 含义 |
|------|---------|------|
| **形** | 构图 + 主体 | 画的什么、怎么摆的 |
| **韵** | 美术风格 + 色彩 + 质感 + 后期 + 媒介 | 什么画风、什么调子 |
| **意** | 氛围 + 光影 + 叙事 | 什么感觉、什么情绪 |
取各子维度 score 加权平均,判断 1-2 个灵魂维度(最有辨识度的)。
### 1d. 写入 decompose.json
合并 origin + dimensions + collapsed + soul 字段写入文件。
---
## Phase 2: 快选
### 展示溯源结论(必须执行)
```
📍 溯源结论
原图来源:[model_guess](置信度 [confidence]
判断依据:[最关键 2-3 条 clues]
灵魂维度:[soul_summary]
🎯 直接调用:[匹配工具] — [一句话说明为什么]
Prompt 写法:[针对该模型的写法策略]
降级方案:[工具不可用时改用什么]
```
**溯源 → 工具 + Prompt 写法对照表**(溯源直接决定调用哪个工具和写法,两者不可分离):
| 溯源来源 | 调用工具 | Prompt 写法 | 降级 |
|---------|---------|-----------|------|
| Seedream | Seedream 生图工具 | 写实长描述,精确五官/服装材质,光线氛围细化 | `all_in_one`,保持写法 |
| Kolors | Kolors 生图工具 | 写实描述,强调高光材质对比 | `all_in_one` |
| Hunyuan | Hunyuan 生图工具 | 写实 + 中式意境词,简洁留白 | `all_in_one` |
| Jimeng / 即梦 | 即梦生图工具 | 直接描述,风格词明确,饱和度显式写出 | `all_in_one` |
| Wanx / 通义万象 | Wanx 生图工具 | 简洁描述,避免过密细节堆叠 | `all_in_one` |
| Midjourney v5/v6 | MJ 生图工具 | 关键词堆叠 + 风格标签,简洁不啰嗦 | `all_in_one`,保持 keyword 写法 |
| Flux.1 | Flux 生图工具 | 自然语言长句,光线材质细描 | `all_in_one`,保持长描述 |
| Stable Diffusion | SD 生图工具 | 支持权重语法 `(词:1.3)`,负面 prompt 单独写 | `all_in_one`,去权重改自然语言 |
| DALL-E 3 | DALL-E 生图工具 | 自然语言,直白描述,避免过度风格化 | `all_in_one` |
| Ideogram | Ideogram 生图工具 | 明确文字内容和排版要求 | `all_in_one` |
| 实拍照片 | 高写实生图工具 | 摄影术语主导,镜头参数 + 胶片型号 | `all_in_one`,保持摄影术语 |
| 手绘 / 插画 | 插画生图工具 | 媒介 + 流派为锚 | `all_in_one`,保持媒介描述 |
| 通用 AI / 难判断 | `all_in_one_image_generation` | 关键词 + 自然语言混合 | 无需降级 |
| 完全不确定 | 多工具各出一张对比 | 每个工具用各自最优写法 | — |
**工具不可用时的降级规则**:降级到 `all_in_one_image_generation`,但**保持原工具的 prompt 写法风格不变**,最大限度保留风格基因。
### 生成路径选择(必须询问)
通过问答询问用户:
- **文生图(推荐)**:纯文字 prompt,零版权风险
- **图生图**:参考图作为 image_ref 传入,还原度更高,需用户确认版权风险
### 内容方向确认
直接问用户"你想画什么",一句话即可进入出图。
若用户没有方向(只说"帮我 remix"),基于灵魂维度推荐 3 个替换方向供选择。
**快捷指令**`换皮`(只换主体)/ `取风格`(保韵)/ `取构图`(保形)/ `取氛围`(保意)
---
## Phase 3: 出图
### 分支 A:文生图(Text-to-Image
严禁将参考图传入生成工具。Prompt 完全基于 Phase 1 分析重建风格。
**Prompt 构建**
```
[新内容主体]. [保留维度的英文 description]. single subject, one image only, no grid, no collage, no text, no watermark
```
**维度→Prompt 重点**
| 保留维度 | Prompt 侧重 |
|---------|------------|
| 形 | 镜头角度、景别、主体位置、纵深层次 |
| 韵 | 艺术流派、色值/色彩关系、媒介描述、调色引用 |
| 意 | 情绪形容词、光源描述、文化/时代引用、隐喻语言 |
### 分支 B:图生图(Image-to-Image
参考图作为 `image_ref` 传入,Prompt 侧重描述新内容方向,风格描述辅助引导。
### 生成参数
询问用户尺寸:**跟随原图**(默认,用 ffprobe 测量后映射)/ 1:1 / 16:9 / 9:16
「跟随原图」映射规则:ratio > 1.5 → 16:90.8~1.2 → 1:1< 0.8 → 9:16。**必须先测量再写入 task_description,禁止猜测。**
默认生成 **4 张**变体,每张单独调用一次,prompt 做轻微变体保持差异。
输出保存到 `.image-remix/{session_name}/outputs/v{版本}_{序号}.png`,同步更新 `generation_log.md`
---
## Phase 4: 迭代
展示结果后询问满意度:**满意结束** / **微调** / **换方向** / **换模型**
微调直接在 prompt 层面调整,不回到 Phase 1 重新分析:
| 反馈 | 动作 |
|------|------|
| "色彩再冷一点" | 微调色彩 prompt 词 |
| "构图换成特写" | 调整镜头参数 |
| "风格差太多" | 增强风格描述或换模型 |
| "这张构图 + 那张色彩" | 组合两张维度重新生成 |
---
## Phase 5: 输出
交付清单:文件位置 / 生成总数 / 迭代轮数 / 灵魂维度 / 溯源来源 / Prompt 写法策略
可选:CDN 上传 / 风格入库(存入 `.image-remix/style-library/{风格名}.md`/ 继续变体
**风格库格式**`references/analysis-example.md` 有示例):
```markdown
# {风格名}
## 溯源
- 原图来源 / 调用工具 / Prompt 写法策略
## 灵魂维度
- 灵魂:{形/韵/意} — {soul_summary}
## 成功 Prompt
{完整英文 prompt}
## 维度快照
- 形 / 韵 / 意
```
+10
View File
@@ -0,0 +1,10 @@
当用户提供一张参考图,并希望生成“感觉相同但内容不同”的新图时触发。
这里的“感觉”包括构图、配色、光线、风格或情绪等维度。
该 skill 会从 10 个美学维度分析参考图,并压缩为 3 个核心轴(形态 / 审美 / 情绪),
再根据原图来源匹配合适模型,并采用适配后的提示词风格进行生成,支持反复迭代优化。
触发词包括:"remix this image"、"make something like this"、"same vibe different content"、
"I like this style make me…"、"replicate this feel"、"同风格不同内容"、"照着这个感觉做"、
"帮我做一张类似风格的图"、"我喜欢这张图的感觉"、"复刻这种效果"、"风格迁移"、"图片remix"
以及任何“用户分享一张图片,希望生成受其美学启发的新图”的请求。
关键区别在于:用户想要的是“受参考图启发的新图”,而不是复制或编辑原图。
不适用于:图片编辑、清晰度增强、格式转换或图生视频。
@@ -0,0 +1,32 @@
# 灵魂维度分析示例
以下是一张参考图的灵魂维度分析报告示例,展示分析输出的格式和深度。
---
参考图:一张日落时分的城市天际线照片,前景有河流倒影,暖色调电影感。
---
## 灵魂维度分析
| 维度 | 分析 | 保留价值 |
|------|------|----------|
| 构图 | 经典三分法构图,天际线占据画面上三分之一,河流从左下角延伸至右侧形成引导线,前景倒影与实景对称营造纵深。画面留白得当,天空占比大,给人呼吸感。 | ⭐⭐⭐ |
| 色彩 | 暖色主导——金橙色天空过渡到深紫色远山,水面反射出冷暖交织的色调。饱和度中等偏高,不过分浓烈但足够吸引眼球。整体色温偏暖,有电影级调色感。 | ⭐⭐⭐ |
| 光影 | Golden hour 自然光,太阳位于画面右侧低角度,逆光打在建筑轮廓上形成剪影效果。水面有柔和的高光散射,暗部保留细节不死黑。明暗对比适中,有层次感。 | ⭐⭐ |
| 风格 | 写实摄影风格,但有明显的后期调色痕迹。质感介于 iPhone 14 Pro 和全画幅相机之间——清晰但不过度锐化。整体有种"cinematic photography"的调性,像电影截图而非纪实摄影。 | ⭐⭐⭐ |
| 氛围 | 宁静、治愈、略带孤独感的黄昏情绪。不是热闹的城市活力,而是站在河边远眺的旁观者视角。有一种"一天结束时的平静"的情感温度。 | ⭐⭐⭐ |
| 主体 | 城市天际线是主体但并非焦点——它更像背景舞台,真正的主角是"光线"和"时刻"。没有人物,建筑也没有细节特写,主体处理偏抽象/情绪化。 | ⭐ |
**灵魂一句话**:这张图打动人的核心是 golden hour 的光线 + 电影感调色 + 宁静旁观者的情绪,构成了一种"美好但转瞬即逝"的氛围。
---
## Remix 方向推荐(示例)
基于灵魂分析,保留光影、色彩和氛围(3 星维度),推荐以下 Remix 方向:
1. **日落沙漠** — 同样的 golden hour 光线和宁静氛围,换成沙丘和远方的地平线
2. **黄昏港口** — 保留水面倒影元素,换成小渔船和灯塔的港口场景
3. **秋日公园** — 暖色调转化为秋叶配色,保留旁观者视角,长椅上的孤独感
@@ -0,0 +1,37 @@
# 模型视觉指纹参考
溯源分析时,对照以下已知模型的视觉特征进行匹配。
## 国产 AI 模型
| 模型 | 视觉指纹 |
|------|---------|
| **Seedream**(字节) | 皮肤极度细腻、奶油感强,面部高度对称接近完美,色彩鲜艳但受控,商业摄影质感,中式审美倾向,服装/布料纹理精细,整体有种"太完美"的商拍感 |
| **Kolors**(快手) | 风格与 Seedream 接近但皮肤更"塑料感",高光区域偏硬,背景虚化方式有特定算法痕迹,人物轮廓线偏锐 |
| **Hunyuan**(腾讯) | 写实与插画之间,面部细节丰富但偶有轻微扭曲,色调偏冷清,构图倾向干净留白,擅长中式场景和水墨融合风格 |
| **Jimeng / 即梦**(字节) | 与 Seedream 同源但风格更多元,常见动漫/插画混合写实,色彩饱和度更高,边缘处理偶有锯齿 |
| **Wanx / 通义万象**(阿里) | 整体偏平,颜色柔和,光影过渡较软,人物比例略显卡通化,背景细节密度低于前景 |
## 国际主流 AI 模型
| 模型 | 视觉指纹 |
|------|---------|
| **Midjourney v5/v6** | 强烈的美学主观性,高光有特有的"MJ 光晕",构图戏剧性强,皮肤细节独特(既写实又带绘画感),人物眼睛常有特定的反光高光点,整体气质偏"高端时尚大片" |
| **Flux.1** | 极高写实度,自然光感强,细节还原接近照片,噪点分布自然,人物无明显"AI感",文字渲染比其他模型准确,材质物理感强 |
| **Stable Diffusion / SDXL** | 因 checkpoint 差异大,常见特征:边缘处有轻微融合瑕疵,手部细节易出错,皮肤有时出现"蜡质感",背景与主体交界处有融合痕迹 |
| **DALL-E 3** | 即使写实风格也带有轻微"插画质感",构图趋于安全/居中,安全性限制导致画面偏"无害化",文字渲染准确,整体有种"儿童读物"的干净感 |
| **Ideogram** | 文字排版能力极强,插画风格鲜明,色块边缘干净,常见平面设计感构图 |
| **Adobe Firefly** | 色彩饱和度偏低/偏"Adobe 色系",写实感适中,背景与主体融合自然但略显保守 |
## 实拍 / 手绘判断
- **实拍照片**:有真实镜头畸变、散景(bokeh)的物理光学特性、噪点分布符合传感器规律、细节随焦距变化有规律性衰减
- **手绘/插画**:可见笔触方向、媒介质感(纸张纹理/颜料堆积)、透视略有主观变形
## 溯源分析重点
1. 皮肤渲染方式(奶油感/塑料感/写实感/绘画感)
2. 高光和反射的处理习惯
3. 边缘融合质量和瑕疵位置
4. 色彩倾向和饱和度控制
5. 整体画面的"AI气质"或"真实感"程度