图像生成
把一句话变成一张没人拍过的图
Image Generation · 文生图 · Text-to-Image
- 是什么——AI「画图」到底在干嘛,是拼贴现成图吗。
- 两件核心事——一句话变成一张图,中间要解决什么。
- 引擎是什么——具体靠什么把图画出来。
- 怎么更可控——只给一句话太粗,怎么精确控制。
- 还做不好什么——现在的图像生成有哪些老大难。
1什么是图像生成直觉
本节回答:AI「画」一张没人拍过的图,它是从图库里拼出来的吗?
所谓图像生成,可以理解为“按条件创造图像候选”:它解决的是“没有现成图片,却希望得到符合描述的新画面”这一问题,而不是从图库里找一张最像的图。
输入可以是一段文字,也可以再带参考图、草图或姿势;输出是一张或多张像素图像。以“戴帽子的柯基”为例,系统先把输入条件转换成内部表示,再根据训练中学到的图像规律采样一个新表示,最后把它解码成可见图片。这里的采样是从许多可能画面中选出一次结果,因此同一句话多运行几次,输出可以不同。
边界:输出通常不是训练集中原样存在的图片,但模型仍可能记住并复现训练片段;所以“生成了一张新图”不能证明它绝对原创、事实正确或可以不受限制地使用。
2它要同时办成两件事工程
「一句话 → 一张图」,中间其实要跨过两道坎。
两阶段生成描述了从“理解要求”到“形成画面”的完整过程,用于解决文字含义与图像像素之间不能直接一一对应的问题。它的输入是提示词和可选控制条件,中间输出是机器可使用的条件表示,最终输出才是图像候选。
| 要办的事 | 解决什么 | 靠什么 |
|---|---|---|
| ① 读懂文字 | 把「戴帽子的柯基、油画、海边」理解成图像层面的意思 | 文本理解 + 图文对齐(见「嵌入」「CLIP」「多模态」) |
| ② 把图画出来 | 在像素、潜变量或视觉 token 空间生成,再解码为协调的新图 | 扩散、自回归等生成引擎 |
它怎样工作:系统先把“柯基、帽子、海边、油画”编码成条件表示,再让生成引擎依照这些条件形成图像表示,然后解码成图片,最后逐项验收对象、关系与风格。图文对齐是让文字和对应画面在内部表示中靠近;视觉 token则是模型处理图像时使用的离散小单元,可以把它暂时理解为“图像版词块”。
| 运行示例:固定 4 个验收项 | 样本 1 | 样本 2 |
|---|---|---|
| 柯基主体 | ✓ | ✓ |
| 帽子戴在头上 | ✗(漂浮) | ✓ |
| 海边场景 | ✓ | ✓ |
| 油画风格 | ✓ | △(偏照片) |
结果与边界:某个候选整体上很像提示词,只说明大方向可能对齐,不能证明每个对象、数量和空间关系都正确。这个“两阶段”解释适合建立任务直觉,但不同模型会把编码、生成和解码组合成不同结构,不能把图中的方框当成所有系统都必须采用的固定部件。
3引擎:当今主要是扩散直觉
具体靠什么把图画出来?
扩散模型指的是通过反复去噪来生成数据的引擎,它解决的是“怎样从随机起点得到既自然又符合文字要求的图像”。这里的噪声可以想成没有可辨对象的随机雪花;条件就是用来约束生成方向的文字或控制图。
输入是一团随机噪声、当前去噪步数和文字条件,每一步的输出是稍微更有结构的中间图像,最终输出才是完整图片。系统先预测当前噪声中哪些变化更像目标画面,再去掉一部分噪声,然后把结果送入下一步;重复多次后,“柯基、帽子、海边”的结构逐渐出现。
边界:增加去噪步数不一定持续提升质量,也不能保证计数、文字或事实正确。扩散只是当前主流路线,不等于图像生成本身;自回归则是按顺序预测下一个视觉单元,像逐词写句子那样逐块形成图像,两种路线各有速度与控制上的取舍。
4完整示例:怎么让它更听话案例推演
只给一句话,控制太粗——想要精确的构图、姿势、局部修改,怎么办?
可控生成所做的,是把结构约束加到文生图过程里,用于解决“文字说得对,但位置、姿势或局部细节仍不可控”的问题。它的输入是在提示词之外增加姿势骨架、深度图、线稿或局部遮罩,输出是既满足文字语义、又尽量服从这些约束的图像。
- 可控生成:在文字之外再加额外条件——一张线稿、一个人体姿势、一张深度图,让生成严格贴着它来(如 ControlNet);或只重绘图里指定的一块(局部重绘),其余保持不动(见「可控生成」)。
- 图像编辑:不是从零生成,而是在已有图上按指令改(换背景、去除某物、扩图),实用场景的主力(见「图像编辑」)。
| 步骤 | 输入 | 本步要检查的输出 |
|---|---|---|
| 1 确定目标 | “红外套人物站在桥左侧,背景是雨夜城市” | 对象、位置、服装和场景被拆成可检查条件 |
| 2 约束构图 | 人物姿态骨架与桥面深度图 | 人物位置和透视遵循控制图 |
| 3 生成候选 | 同一条件下固定 4 个随机种子 | 分别检查贴题、自然度和候选间多样性 |
| 4 局部修订 | 只遮罩错误的手部区域 | 手部改善且脸、衣服、桥面未被意外改写 |
它怎样工作:先把模糊愿望拆成可检查条件,再用结构图约束整体构图,然后生成多个候选,最后只遮罩错误区域做局部重绘。随机种子是产生随机起点的编号;固定它有助于比较改动前后差异,但这个编号本身不代表质量高低。
怎样解释结果:若只有个别候选失败,说明随机采样造成波动;若四个候选都在同一位置失败,更像是条件表达不清、约束冲突或模型没有学好这种组合,应回查输入,而不是只继续“抽卡”。
边界:控制条件越多并不一定越好。若姿态图要求人物站在左边、文字却要求人物在右边,系统无法同时完全服从;局部重绘也可能连带改变邻近区域,因此必须明确优先级并复查未遮罩部分。
5它现在还做不好什么工程
能力随模型快速变化,下面不是永久缺陷清单,而是部署时应持续评测的高风险维度。
能力边界评测记录模型在不同失败类型上的表现,用于解决“展示图很好看,却不知道系统在真实任务中会在哪里失灵”的问题。它的输入是一组覆盖文字、计数、空间关系、一致性和事实性的测试提示,以及每条提示规定的采样次数;输出是各类错误的成功率、失败率和代表案例。
- 图中文字与版式:新模型已明显改善短文本,但长文、多语言、精确排版与可编辑字体仍需逐模型评测。
- 组合与复杂结构:手部只是一个例子;更普遍的是计数、空间关系、遮挡、对称和多对象属性绑定可能出错。
- 一致性:让同一个角色在多张图里保持长相一致,很难。
- 事实性:它生成的是「看起来对」的图,不是「真的准确」的图——和大模型的幻觉同源。要求科学准确的示意图时尤其要核对(见「幻觉」)。
它怎样工作:先为每个高风险维度设计一组固定提示,再让同一模型按统一分辨率和采样预算重复生成,然后由明确的标注规则记录错误类型,最后比较不同维度和版本。看到一张成功图,只说明该次采样成功;某一类提示在多次生成中仍频繁失败,才说明它是可重复的能力短板。
6怎么评估:好看、贴题与安全不是一个分数工程
“这张图质量高”到底是在说什么?
多维评估比较的是“质量”的不同侧面,而不是寻找一个万能总分,用于避免一张好看的图掩盖贴题错误、身份漂移或安全风险。它的输入是固定提示集、模型版本、随机种子策略、采样预算和人工评分规则;输出不是一个万能总分,而是各维度分数、失败类型和高风险案例。
至少要分开评估:感知质量是画面是否自然,提示对齐是对象、关系和文字是否符合要求,多样性是候选是否只是近似复制,身份一致性是同一角色跨图是否保持特征,事实与安全则检查内容是否可信、合规。人工盲评是让评价者不知道图片来自哪个模型,减少品牌与顺序偏见;安全红队是主动设计高风险请求来寻找系统漏洞。
它怎样工作:先固定提示、分辨率和采样次数,再对每条提示重复生成,然后让自动指标做批量筛查、让人工按维度盲评,最后单独汇总失败类型与安全问题。
怎样解释与适用边界:某个维度更高,只表示该维度在这组测试条件下更好,不能自动推出整体更好。自动指标难覆盖构图偏好和高风险语义,人工评分也会受文化、任务与顺序影响;安全失败不能被其它维度的高分平均掉。
7它带来的新问题安全
能凭空造出逼真图像,也带来了纯技术之外的麻烦。
生成图像治理,可以理解为贯穿生成前、生成中和发布后的风险控制,用于降低版权侵害、冒充真人、诈骗和虚假传播。它的输入包括用户请求、涉及的人物与素材、授权状态和使用场景;输出包括允许、限制或拒绝决定,以及对生成内容的标记、来源记录和人工复核结果。
- 版权争议:训练数据里包含大量受版权保护的作品,「学了别人的画风再生成」的边界仍在争论。
- 深度伪造:能生成以假乱真的人物图像,用于造谣、诈骗、侵权。
- 检测与水印:由此催生「判断一张图是不是 AI 生成」的技术,和生成能力在军备竞赛(见「AIGC 检测与水印」)。
它怎样工作:生成前先检查身份、授权与用途,生成时限制明显高风险请求,生成后再添加来源信息、保留审计记录并对敏感内容人工复核。水印是在文件或画面中加入来源线索;检测器则根据统计特征估计图片是否由 AI 生成,两者作用不同。
8把整条因果链连起来综合
从文本语义、条件注入到图像采样与分项验收,把“看起来不错”拆成可检查机制。
- 图像生成是造一张全新的图,不是检索拼贴。(§1)
- 它要同时办两件事:读懂文字(图文对齐)+ 把图画出来(生成引擎)。(§2)
- 当今引擎主要是扩散:去噪生成,文字作为条件注入。(§3)
- 可控生成和图像编辑给了更细的方向盘。(§4)
- 软肋:图里写字、手指、一致性、事实性(与幻觉同源)。(§5)
- 评估必须拆开好看、贴题、一致性、事实和安全,不能只报一个总分。(§6)
- 还带来版权、深伪、检测水印等技术之外的问题。(§7)
9常见误解直觉
| 误解 | 更准确的理解 |
|---|---|
| AI 画图是从图库拼贴 | 通常是从学到的分布采样图像表示,不是简单检索拼贴;但模型可能记忆并复现训练片段 |
| 图像生成 = 扩散模型 | 图像生成是任务,扩散是当今主流引擎(还有 GAN、自回归等) |
| 它生成的图是准确的 | 是「看起来对」,可能与事实不符,与幻觉同源 |
| 写好提示就能让图里出现正确文字 | 「图中准确写字」仍是老大难,需专门能力/工具 |
| 生成能力只是技术问题 | 还牵涉版权、深伪、检测水印等伦理与法律问题 |
10检查你是否真的理解自测
- AI 图像生成是检索拼贴现成图吗?它到底在做什么?
- 「一句话变成一张图」要同时办成哪两件事?各靠什么?
- 「图像生成」和「扩散模型」是什么关系?
- 想精确控制构图/姿势或只改局部,有哪些手段?
- 图像生成现在有哪些稳定的软肋?为什么说「事实性」问题和幻觉同源?
- 它带来了哪些技术之外的问题?
参考答案
- 不是简单拼贴;它在像素、潜变量或视觉 token 空间采样并解码,但仍需防范训练样本记忆与复现。
- 读懂文字(文本理解+图文对齐)和把图画出来(生成引擎);分别靠 CLIP 式对齐和扩散等引擎。
- 图像生成是任务,扩散是当今实现它最主流的引擎,此外还有 GAN、自回归等路线。
- 可控生成(加线稿/姿势/深度等额外条件、局部重绘)和图像编辑(在已有图上按指令改)。
- 图里写字、手指与复杂结构、多图角色一致性、事实性;事实性是因为它生成「看起来对」而非「真的准」,与大模型幻觉同源。
- 训练数据版权争议、深度伪造、以及由此催生的 AIGC 检测与水印。
11概念依赖与延伸学习路线
| 学习层级 | 涉及概念 |
|---|---|
| 先修 | 扩散模型、嵌入、CLIP、多模态 |
| 本页核心 | 任务 vs 引擎、文本理解+对齐、软肋(写字/一致性/事实性) |
| 紧邻延伸 | 可控生成、图像编辑、超分辨率、生成对抗网络 GAN |
| 更远 | 视频生成、AIGC 检测与水印、幻觉、AI 治理 |
- Rombach et al., Latent Diffusion Models:潜空间文生图与条件交叉注意力。
- Saharia et al., Imagen:文本编码、级联扩散与图文对齐。
- Ramesh et al., Hierarchical Text-Conditional Image Generation with CLIP Latents:CLIP 潜变量与扩散解码。