AI 绘画入门:一张图是怎么从文字里“长”出来的
AI 图像生成,本质是"用文字或图,让模型画出一张新图"。2026 年主流两家:Stable Diffusion(开源生态)和 Midjourney(闭源在线王者)。本篇讲清楚它们和怎么选。
Stable Diffusion 家族
开源、能本地跑、生态爆炸:SD1.5、SDXL、再到 FLUX 系列,加上 ControlNet、LoRA、各种采样器,玩法最自由。代价是要折腾环境和参数。
Midjourney
闭源,在网页/Discord 里输提示词出图,审美和"出片率"很稳,新手最容易出好看的图。缺点是控制权少、按订阅付费、不上本地。
怎么选
想省心出美图、做概念探索,MJ 快;要可控、可批量、可私有、接工作流,SD/FLUX + ComfyUI 是归宿。
提示词怎么写出生图
生图 prompt 的骨架是"主体 + 环境 + 风格 + 光线 + 镜头"。比如"一个戴草帽的女孩,站在向日葵花田里,宫崎骏动画风,午后暖光,广角镜头",五个维度都给到,出来的图才有画面感。只写"漂亮的女孩",模型只能给你一个最平庸的默认值。
进阶玩法是权重语法。用 (red hair:1.3) 这种写法给某个词加权,用 [blue:red:0.5] 做transition,能精确拿捏细节。中文模型(如通义万相)直接写中文也行,但英文提示词在主流模型上理解更准,关键描述混点英文往往更稳。
出图翻车怎么办
最常见的多手指、畸形脸,优先用"局部重绘(inpaint)"圈出坏掉的地方重生成,比整张重画省时;手部问题也能靠专门的手部修复模型(如 handfix)补一刀。其次是用负向提示词(negative prompt)把"多指、模糊、扭曲"列进去,从源头压住。
还有一种隐性翻车是"没按你想的构图来"。这时候别猛加权重硬刚,试试用 ControlNet 垫一张姿势/线稿图,或者直接换模型——不同底模对同一个 prompt 的诠释差很远。出图本质是"和模型对话",多试几轮、记下哪套词对应哪类效果,比盲目堆描述管用。
