三亩地 三亩地SAN MU DI · CODE DIARY
ARTICLE DETAIL

日记详情

真实记录编程学习的某一天,欢迎挑你感兴趣的翻一翻。

AI绘画提示词工程指南:从基础语法到实战模板

AI绘画提示词工程指南:从基础语法到实战模板

在AI绘画和图像生成领域,你是否也遇到过这样的困扰:明明想画一幅“赛博朋克城市夜景”,AI却给你生成了一堆光污染的马赛克;想要一张“充满细节的奇幻森林”,结果出来的树长得像西兰花。问题往往不在于模型本身,而在于你与AI沟通的“语言”——提示词(Prompt)。

网上关于提示词的资料要么是零散的词汇列表,要么是充满玄学的“咒语”汇编,真正系统、可实操的工程化指南少之又少。本文旨在打破这种局面,为你提供一份从底层逻辑到实战技巧的“AI分析图提示词大全”。我们将彻底拒绝废话,直接切入核心,拆解提示词的构成要素、高级技巧、场景化模板,并提供可直接复用的代码示例(针对Stable Diffusion等开源模型)。无论你是刚入门的新手,还是希望提升出图质量的老手,都能在这里找到一套清晰、可落地的提示词工程方案。

1. 提示词的核心概念与价值:为什么它如此重要?

在深入技巧之前,我们必须理解提示词的本质。它不是你向AI许的愿,而是你为AI模型编写的、高度结构化的“程序指令”。

1.1 提示词是什么?

提示词(Prompt)是用户输入给文本到图像(Text-to-Image)生成模型的一段文本描述,用于指导模型生成符合预期的图像。你可以把它理解为:

  • 翻译器:将人类模糊的想象,翻译成模型能理解的数学向量。
  • 导航图:在模型庞大的“概念空间”中,为生成过程划定一条明确的路径。
  • 配方表:精确指定了最终图像需要包含哪些“原料”(主体、风格、细节)以及它们的“配比”。

1.2 提示词如何工作?

以Stable Diffusion为例,其工作流程简化如下:

  1. 文本编码:你的提示词通过一个专门的文本编码器(如CLIP)被转换为一组高维向量(嵌入向量)。
  2. 去噪过程:模型从一个纯随机噪声图像开始,根据这组文本向量所蕴含的语义信息,一步步“去除”噪声,使图像逐渐清晰并贴近描述。
  3. 迭代生成:这个过程在潜空间(Latent Space)中进行多次迭代(步数),每一步都受到提示词向量的“牵引”。

关键点:提示词中的每个词汇、短语,都对应着模型在训练中学到的特定视觉概念。组合它们,就是在组合这些概念。

1.3 优质提示词的价值

  • 控制力:从“抽卡”变为“定向创作”,大幅提高目标图像的生成概率。
  • 质量:引导模型关注细节、光影、构图,产出更具艺术感和完成度的作品。
  • 效率:减少反复尝试和调整的次数,快速得到可用结果。
  • 独特性:通过组合罕见或特定的词汇,创造出独一无二的视觉风格。

2. 环境准备与工具说明

虽然本文重点在提示词本身,但为了后续的实战验证,我们需要一个可运行的环境。这里以开源且强大的Stable Diffusion WebUI (AUTOMATIC1111)为例,它是学习和实验提示词的最佳平台。

2.1 基础环境要求

  • 操作系统:Windows 10/11, Linux, 或 macOS (Apple Silicon 推荐)
  • Python:3.10.x 版本(这是SD WebUI的兼容性要求,务必确认)
  • Git:用于克隆仓库
  • 显卡:推荐 NVIDIA GPU,显存至少 4GB (6GB+ 可获得更好体验)。AMD GPU 和 Apple Silicon 也可运行,但配置稍复杂。

2.2 安装 Stable Diffusion WebUI

以下是基于 Windows 的简化安装步骤。其他系统请参考官方Wiki。

  1. 安装 Python 3.10.6

    • 从 Python 官网下载安装包,安装时务必勾选 “Add Python to PATH”。
  2. 安装 Git

    • 从 Git 官网下载安装,使用默认选项即可。
  3. 克隆仓库并启动: 打开命令提示符(CMD)或 PowerShell,执行以下命令:

    # 克隆 Stable Diffusion WebUI 仓库 git clone https://github.com/AUTOMATIC1111/stable-diffusion-webui.git cd stable-diffusion-webui # 启动安装脚本(首次运行会自动下载模型等依赖) webui-user.bat

    首次运行会下载数个GB的模型文件,请保持网络通畅。完成后,命令行会显示一个本地URL(通常是http://127.0.0.1:7860)。

  4. 下载基础模型

    • 启动后,WebUI 默认可能不带模型。你需要下载一个基础模型(如sd_xl_base_1.0.safetensors)并放入stable-diffusion-webui/models/Stable-diffusion/目录。
    • 模型可以从 Civitai 或 Hugging Face 等平台获取。

2.3 WebUI 界面初识

启动后,在浏览器打开本地URL,你会看到主要区域:

  • 正向提示词(Prompt):输入你希望图像包含的内容。
  • 反向提示词(Negative Prompt):输入你希望图像避免的内容(极其重要!)。
  • 采样方法(Sampler):如 Euler a, DPM++ 2M Karras 等,影响生成过程和细节。
  • 采样步数(Sampling Steps):迭代次数,通常20-30步是质量与速度的平衡点。
  • 提示词引导系数(CFG Scale):模型遵循提示词的强度,7-12是常用范围。
  • 种子(Seed):随机数种子,固定种子可以复现同一张图。

3. 提示词工程:从基础语法到高级结构

提示词不是简单的关键词堆砌,它有内在的语法和结构。掌握这些,你的提示词就从“单词表”升级为“编程语言”。

3.1 基础语法与权重控制

  1. 逗号分隔:最基本的语法是用英文逗号,分隔不同的概念。这有助于编码器区分独立要素。

    • a cat, on a sofa, sunny room(一只猫,在沙发上,阳光房)
  2. 括号与权重:这是精细控制的核心。

    • (word):增加该词汇的权重,相当于(word:1.1)。模型会更关注它。
    • [word]:降低该词汇的权重,相当于(word:0.9)
    • (word:1.5):明确指定权重系数。1.5表示重要性是默认的1.5倍。
    • ((word))(word:1.21):多重括号可以叠加效果,但需谨慎使用,权重过高(如>1.5)可能导致图像扭曲。
    • 示例对比
      • a cat, a dog:猫和狗可能同等重要。
      • (a cat:1.3), a dog:猫会更突出。
      • a cat, [a dog]:狗的存在感会被削弱。
  3. 交替语法[A|B]:让模型在A和B两个概念之间进行“融合”或“交替”生成,可以创造出混合风格。

    • [cyberpunk|steampunk] city:生成赛博朋克与蒸汽朋克风格混合的城市。

3.2 结构化提示词公式

一个高效、通用的提示词通常遵循以下结构,我们可以将其视为一个公式:

[图像类型], [主体描述], [细节与属性], [构图与镜头], [艺术风格], [渲染与画质], [颜色与光影]

让我们拆解每个部分:

  • 图像类型:指明图片的根本类别,帮助模型确定整体框架。
    • photograph,illustration,3D render,digital painting,sketch,concept art,anime screencap
  • 主体描述:谁或什么是画面的核心。要具体!
    • 基础:a Chinese woman,a robotic wolf
    • 进阶:a young archaeologist with a dusty hat and determined eyes,a majestic dragon coiled around a crystal spire
  • 细节与属性:为主体添加特征,使其生动。
    • 服饰:wearing a tailored trench coat,in intricate plate armor
    • 表情动作:smiling gently,sprinting dynamically,holding a glowing orb
    • 材质纹理:metallic surface,weathered wood,flowing silk
  • 构图与镜头:控制画面的视角和布局,这是专业度的体现。
    • 景别:close-up,medium shot,full body,extreme long shot
    • 角度:low angle,bird's-eye view,dutch angle
    • 构图法则:rule of thirds,symmetrical composition,leading lines
    • 镜头效果:depth of field,motion blur,fish-eye lens
  • 艺术风格:决定图像的美学基调。
    • 艺术家/工作室:by Studio Ghibli,art by Greg Rutkowski(注:使用在世艺术家名可能涉及伦理问题)
    • 艺术运动:impressionism,art nouveau,synthwave
    • 通用风格:fantasy art,sci-fi,minimalist,vintage poster
  • 渲染与画质:这是让图像从“像AI画的”变成“像真的/专业的”关键。
    • 渲染引擎:Unreal Engine 5,Octane render,V-Ray
    • 画质词:highly detailed,intricate details,sharp focus,8K,UHD
    • 专业术语:subsurface scattering,volumetric lighting,photorealistic
  • 颜色与光影:设定画面的情绪和氛围。
    • 色调:warm color palette,monochromatic blue,vibrant colors
    • 光影:cinematic lighting,soft daylight,dramatic shadows,neon glow,bioluminescence

3.3 反向提示词:定义“不想要什么”

反向提示词与正向提示词同等重要,它用于排除常见的低质量特征和不符合预期的元素。

通用高质量反向提示词模板

(worst quality, low quality, normal quality:1.4), lowres, bad anatomy, bad hands, text, error, missing fingers, extra digit, fewer digits, cropped, jpeg artifacts, signature, watermark, username, blurry, deformed face, ugly, duplicate, morbid, mutilated, extra limbs, poorly drawn hands, poorly drawn face, mutation, deformed, bad proportions, malformed limbs, fused fingers, too many fingers, long neck

你可以直接复制使用这个模板,它能有效避免大多数崩坏、低清和畸形问题。

场景化反向提示词

  • 人物肖像:asian, child(如果不想要亚洲面孔或儿童)
  • 风景:people, buildings, cars(如果只想生成纯净的自然景观)
  • 特定风格:photorealistic(如果正在生成插画,不希望它过于写实)

4. 实战案例:分场景提示词模板与生成演示

现在,我们将上述理论应用于具体场景,提供可直接复制修改的模板,并在WebUI中演示效果(描述性说明)。

4.1 场景一:高质量人物肖像(奇幻风格)

目标:生成一位精灵弓箭手的半身肖像,要求细节丰富,光影具有电影感。

正向提示词

masterpiece, best quality, ultra-detailed, illustration, 1girl, elf archer, long silver hair, pointed ears, emerald green eyes, wearing leather armor with leaf patterns, holding an ornate wooden bow, intricate braids, serene expression, looking at viewer, in a sun-dappled ancient forest, sunbeams filtering through canopy, cinematic lighting, soft volumetric fog, depth of field, fantasy art, art by Alphonse Mucha and Artgerm, trending on ArtStation, 8K

拆解分析

  • masterpiece, best quality...:画质锚定词。
  • 1girl, elf archer...:明确主体及其特征(种族、发型、装备)。
  • in a sun-dappled ancient forest...:环境与光影细节,增加故事感。
  • cinematic lighting, depth of field:专业摄影术语,提升质感。
  • art by... trending on ArtStation:风格指引,指向高审美平台和艺术家风格。

反向提示词

(worst quality, low quality:1.4), deformed, blurry, bad anatomy, disfigured, poorly drawn face, mutation, mutated, extra limb, ugly, poorly drawn hands, missing limb, blurry, floating limbs, disconnected limbs, malformed hands, out of focus, long neck, long body, ugly, disgusting, poorly drawn, childish, mutilated, mangled, old, surreal

WebUI 参数建议

  • 采样方法:DPM++ 2M Karras
  • 步数:28
  • CFG Scale:7.5
  • 分辨率:768x1024 (竖版适合半身像)

4.2 场景二:科幻概念场景(赛博朋克城市)

目标:生成一个雨夜中的未来都市街景,充满霓虹灯和全息广告。

正向提示词

cyberpunk city street at night, raining, wet asphalt reflecting neon lights, towering skyscrapers with holographic advertisements, flying cars, crowded with diverse crowd of humans and androids, neon signs in Chinese and Japanese, dense fog, cinematic, wide angle shot, low angle, vibrant colors of pink, blue and purple, volumetric lighting, rays of light through rain, highly detailed, digital painting, concept art, 3D render, Unreal Engine 5, RTX on

拆解分析

  • cyberpunk city street at night, raining:定下核心场景和天气。
  • wet asphalt... holographic advertisements:通过具体细节(潮湿地面、全息广告)强化氛围。
  • crowded with...:增加场景的生机与复杂感。
  • neon signs in Chinese and Japanese:赛博朋克经典文化元素。
  • Unreal Engine 5, RTX on:使用现代渲染引擎术语,引导模型产出具有逼真光影和材质的图像。

反向提示词

sunny, daytime, empty, barren, lowres, bad anatomy, bad hands, text, error, missing fingers, extra digit, fewer digits, cropped, worst quality, low quality, normal quality, jpeg artifacts, signature, watermark, username, blurry, soft, dull, flat

WebUI 参数建议

  • 采样方法:Euler a (有时能产生更动态、艺术化的效果)
  • 步数:30
  • CFG Scale:10 (对于复杂场景,可以稍高以加强引导)
  • 分辨率:1024x768 (横版适合广阔场景)

4.3 场景三:产品设计与渲染(极简主义台灯)

目标:生成一张可用于产品页面的、具有极简设计感的白色台灯3D渲染图。

正向提示词

product photography, a minimalist white ceramic table lamp, clean design, smooth curves, isolated on a light gray marble tabletop, against a soft gradient pastel background, studio lighting, soft shadows, sharp focus, high detail, professional 3D render, octane render, clean edges, matte finish, aesthetic, Scandinavian design, Behance, Dribbble, 4K

拆解分析

  • product photography:明确图像用途。
  • a minimalist white ceramic table lamp:主体描述,强调材质和风格。
  • isolated on... against...:控制背景,突出产品主体。
  • studio lighting, soft shadows:专业布光术语。
  • octane render:指定渲染器,倾向于产生干净、材质感强的图像。
  • Behance, Dribbble:指向设计社区,引导模型学习高质量设计作品的视觉风格。

反向提示词

cluttered, messy, dirty, scratched, broken, deformed, ugly, text, logo, watermark, people, hands, blurry, noise, grainy, dark, low contrast, oversaturated, cartoon, drawing, sketch, painting

5. 高级技巧与进阶策略

当你掌握了基础结构后,以下技巧能帮助你解决更复杂的问题或创造出独特效果。

5.1 使用LoRA/LyCORIS等微调模型

LoRA等模型是小型附加网络,可以大幅改变风格或注入特定角色/概念,而无需修改大模型。

用法: 在提示词中加入特定的触发词,格式通常为<lora:模型文件名:权重>

  • 例如,你下载了一个“盲盒手办风格”的LoRA模型blindbox_v1.safetensors
  • 提示词可以写为:a cute cat, <lora:blindbox_v1:0.8>, ...
  • 权重通常从0.5-1.0开始尝试,过高可能导致过拟合。

5.2 分层渲染与分步提示

通过扩展插件(如Dynamic Prompts或Composable Diffusion),可以实现更复杂的控制。

  • 场景分层:先描述背景,再描述前景人物。
  • 分步控制:在生成的不同步数阶段,强调不同的提示词。这通常需要编写脚本或使用高级插件,是专业工作流的体现。

5.3 负面嵌入(Negative Embeddings)

这是预训练好的“反向提示词模型”,能更有效地抑制某些不良特征。最著名的是EasyNegativebad-hands-5

  • 用法:在WebUI的“嵌入”标签页下载,然后在反向提示词框中输入其文件名(如EasyNegative)即可调用,效果通常比纯文本反向提示词更强。

5.4 提示词矩阵与批量生成

利用{A|B|C}语法进行批量探索。

  • 示例:a {cat|dog|fox} sitting in a {forest|library|spaceship}
  • 这会在一次生成中,组合出9种(3x3)不同的可能性,高效探索创意方向。

6. 常见问题与排查思路

在提示词实践中,你会遇到各种问题。下表列出了典型问题及其解决方法。

问题现象可能原因排查与解决思路
图像模糊、缺乏细节1. 提示词过于简单笼统。
2. 使用了低权重的画质词。
3. CFG Scale过低。
4. 采样步数不足。
1. 在正向提示词开头添加masterpiece, best quality, ultra-detailed, 8K等锚定词。
2. 增加画质词的权重,如(highly detailed:1.3)
3. 逐步提高CFG Scale(7-12区间)。
4. 增加采样步数至25-30。
人物脸部或手部畸形1. 模型在复杂结构上训练不足。
2. 构图过于复杂(如多个主体)。
3. 分辨率不匹配模型训练数据。
1. 在反向提示词中强化bad anatomy, bad hands, deformed fingers
2. 使用easynegative, bad-hands-5等负面嵌入。
3. 简化构图,尝试portraitclose-up先生成好脸部。
4. 使用ADetailer等面部修复插件进行后期处理。
忽略部分提示词1. 提示词冲突或过于复杂。
2. 某些词权重被其他词淹没。
3. CFG Scale过高导致语义饱和。
1. 检查提示词逻辑,移除可能矛盾的部分(如summersnow)。
2. 提高被忽略词汇的权重,或用括号包裹。
3. 适当降低CFG Scale。模型会优先关注权重最高的概念。
风格混杂或不纯1. 提示词中包含了多种冲突的风格描述。
2. 使用了多个风格强烈的LoRA且权重过高。
1. 明确主风格,将其放在提示词靠前位置并增加权重。
2. 移除或降低次要风格的权重。
3. 如果使用多个LoRA,降低它们的权重(如0.7 each),让它们协同而非竞争。
生成内容总是雷同1. 提示词过于具体和固定。
2. 种子(Seed)被固定。
1. 在提示词中加入一些随机性元素,如dynamic pose,mysterious atmosphere
2. 将种子设为-1(随机),或使用提示词矩阵探索变体。
3. 尝试不同的采样方法(如从Euler a换到DPM++ 2M Karras)。

7. 最佳实践与工程化建议

将提示词工程视为软件开发的一部分,遵循以下实践可以提升效率和产出稳定性。

7.1 建立与管理提示词库

不要每次都从零开始。建立个人提示词库。

  • 分类存储:按主题(人像、场景、产品)、风格(写实、二次元、油画)、用途(头像、壁纸、概念图)分类。
  • 记录元数据:保存成功的提示词时,同时记录使用的模型名称关键参数(采样器、步数、CFG)、种子(如果重要)和生成的缩略图。可以用笔记软件(如Notion、Obsidian)或专门的AI工具管理。
  • 使用模板:为常用类型创建基础模板,每次只需修改主体和细节部分。

7.2 迭代与优化流程

  1. 草稿阶段:用简短的提示词(3-5个核心词)快速生成几张图,确定大致方向和构图。
  2. 细化阶段:选择一张最有潜力的草图,在此基础上,按照第3.2节的结构化公式,逐步添加细节词、风格词和画质词。每次只添加或修改1-2个词,观察变化。
  3. 微调阶段:调整权重(),优化反向提示词,微调参数(CFG, 步数)。使用“生成”按钮旁边的“附加功能”或“X/Y/Z图表”脚本进行参数网格搜索。
  4. 收尾阶段:固定满意的种子,如果需要更高分辨率,使用“高清修复”(Hires. fix)功能进行放大,而不是直接生成超大图(容易爆显存且导致结构错误)。

7.3 伦理与版权意识

  • 尊重原创:谨慎使用在世特定艺术家的名字作为风格提示。虽然这是常见做法,但可能涉及风格抄袭的争议。更推荐使用通用的艺术运动或风格术语。
  • 内容安全:了解你所使用平台的规则,避免生成暴力、色情或侵权内容。合理使用反向提示词进行约束。
  • 注明来源:如果使用了特定的LoRA、Embedding或模型,在分享作品时予以注明,尊重社区开发者的劳动。

7.4 性能与成本考量

  • 本地部署:Stable Diffusion WebUI本地运行免费,但对硬件有要求。合理设置分辨率、批处理数量,以在质量和生成速度间取得平衡。
  • 云服务/API:使用Midjourney、DALL-E 3等在线服务时,提示词的精准度直接关系到消费点数/Token。更精确的提示意味着更少的重试次数,更省钱。
  • 批量生成:对于需要大量尝试的场景,利用脚本或插件进行批量生成,并自动筛选,是工业化生产的思路。

掌握提示词,就是掌握了与AI视觉模型高效对话的钥匙。它不再是神秘的黑魔法,而是一项可学习、可拆解、可优化的工程技能。从理解基础语法和结构开始,到熟练运用权重控制和高级技巧,再到建立个人的提示词工作流,每一步都能显著提升你的创作效率和作品质量。记住,最好的学习方式是动手实验:复制文中的模板,修改其中一个词,观察变化;尝试组合不同的风格;记录下哪些词对你的常用模型特别有效。随着模型本身的快速进化,提示词的最佳实践也在不断更新,保持好奇,持续实践,你将能持续驾驭这股强大的创造力。

← 返回列表