像艺术总监一样给图像 Agent 下指令,而不是像搜索框

教程7 分钟阅读

想让 AI Agent 快速出好图,第一步是别再像搜索框那样写提示词。搜索框要的是关键词,而艺术总监给的是 brief:画面里在发生什么、怎么打光、这张图为什么存在。用三行说清楚,把风格交给 Agent,然后在一张成图上迭代,而不是连掷五次骰子。下面讲清楚方法、一个完整示例,以及一张「有效 brief 对比无效 brief」的表。

教程

搜索框的习惯,正是提示词跟你对着干的原因

大多数人写提示词就是堆形容词:「超精细、电影感、8k、热门、大师之作、戏剧光影、极致写实」。这是搜索框式思维——塞够标签,指望排序帮你捞出点东西。可图像模型不排序,它在构图。一大串修饰词没给模型任何可搭建的场景,于是它把这些词平均成一团糊,你只能反复重掷,直到某一次碰巧成了。

艺术总监绝不会用一堆关键词去指导摄影师。他们会说:画面里有什么、光怎么落、这张图是干什么用的。这是三个决策,也正是模型能据此行动的东西。在图像 Agent 上,你还能省掉第四个决策——风格——因为 Agent 已经替你握着它。

三行 brief

把每一次出图请求写成三行短句。不是三段——是三行。每行回答一个导演在现场会问的问题。

  1. 主体 + 瞬间。 谁或什么,在做什么,在哪一刻。不是「一名骑士」,而是「一名骑士在雨点落下时放下面甲」。戏就藏在那个瞬间里。
  2. 光线。 光从哪来、什么质感。「低斜阳从左侧扫过,拉出长影」。光对氛围的作用胜过任何形容词。
  3. 意图。 这张图做什么用、什么该先被看到。「主视觉——剪影在缩略图尺寸下也要认得出」。这告诉模型在构图时要护住什么。

注意少了什么:没有媒介、没有调色、没有「电影感」、没有相机品牌、没有画质标签。那些是 Agent 的活。你负责 brief 这个镜头,Agent 负责提供这个观感

为什么风格不用你写:Agent 替你握着

裸模型是一件空白乐器——它什么都能做,也就意味着你每一次都得把一切说全。ReelWand 的 Agent 是裸模型加上一套驻留在服务端的风格 DNA:媒介、打光理念、色彩调性和画质底线,在请求到达模型之前就被拼进每一次调用。你不用反复输入「哑光概念画、空气透视、笔触边缘」——概念原画工坊 早已带着它。

这也正是抵得住「截图照搬」的部分:大脑从不离开服务器。别人能截下你的成图,却搬不走配方,因为配方从没出现在你的提示词里。这是 jenova 为文本 Agent 造出的护城河,如今用到了视觉上。落到实处:你的三行 brief 始终短小、可复用,而 Agent 出的每一张图,都像出自同一家工作室。

完整示例:从关键词堆到 brief

假设你想要一张悬崖之城的概念图。多数人第一反应会敲出这样的搜索框版本:

cliffside city, fantasy, epic, hyper detailed, 8k, cinematic lighting, artstation, masterpiece, ultra realistic, beautiful, trending, concept art, unreal engine

它读起来像一串 SEO 标签,因为它就是 SEO 标签。模型没有瞬间、没有光的方向,也不知道什么该先被看到。再看同一个想法的三行 brief:

  • 主体 + 瞬间: 一座凿进海崖的垂直之城,货运升降梯正爬到半途,几个小小的人影走过一座绳桥,用来带出尺度感。
  • 光线: 午后偏晚的阳光从海的一侧打来,塔身暖调,峡谷里积着冷调阴影。
  • 意图: 主视觉——海崖剪影与那种垂直的尺度感,即便缩成缩略图也要认得出。

第二个版本想起来更省事,渲染起来却丰富得多。它有一个瞬间(升降梯爬到半途)、一个有理由的光源(海侧午后阳光)、一个任务(剪影在缩略图尺寸下要认得出)。哑光概念画的媒介、空气感的雾霭、调色,都由 Agent 补上——你没写一个风格词,成图却和这家工作室的其余作品保持同一副面孔。

好 brief 对比差 brief

你想要的搜索框写法(避免)三行 brief(这样写)
一张有情绪的肖像portrait, moody, dramatic, cinematic, 8k, bokeh, masterpiece主体: 一名小提琴手在两条之间歇息,垂着眼。光线: 单只暖灯从镜头左侧打来,衰减很深。意图: 杂志封面——脸和手撑起整个画面。
一张产品主图product photo, professional, studio, clean, high quality, commercial主体: 一只哑光陶瓷马克杯,热气刚升起。光线: 柔和的左上主光,右边缘一道淡淡轮廓光。意图: 主图——剪影与热气在白底详情页上要清晰。
一张生物设定monster, scary, detailed, fantasy, epic, trending, artstation主体: 一头空鲸转身俯冲到一半,露出布满藤壶的腹面。光线: 阳光在它身后,半透明的鳍在发光。意图: 设定表——解剖与尺度要能让建模师读清。

差的那一列不是「用错了词」,而是没有任何决策。每一个「避免」格都能形容一千张不同的图;每一个「这样写」格只形容其中一张。

迭代,别整段重生成

整段重生成不过是搜索框习惯换了层皮:结果不满意,就再转一次转盘、求个好运。执导意味着留住有效的部分、只改一件事。在 ReelWand 上,这是内建的——会话记忆让你的下一句提示在上一帧的基础上迭代(2 小时窗口内),而不是从零开始。

  • 一次只改一个变量。 「把太阳压低一点」或「清掉前景杂物」——不是换一整份 brief。你才能弄清每条批注各自起了什么作用。
  • 说清要改什么,别重述整个场景。 Agent 手里已经有这个镜头;你给的是导演批注,而不是重新描述布景、演员和灯光。
  • 模型允许时就做局部修正。 只有天空不对,就只改天空。整段重生成是在拿已经对的部分去赌。
  • 为可复用的工作加一份规则手册。 ReelWand 的知识层会把一份成文的品牌规则手册检索进每一次生成,让配色和构图规则贯穿整组图,而不只是一张。

好处会叠加:积分制下静态图比视频便宜,图像迭代成本很低,等你把一套观感搬进动态时,你早已确认过这份 brief 管用。如果你想给视频也上同一套纪律,姊妹篇在导演化视频工作流里保持角色一致讲的正是如何让主体在整段镜头里不脱形。

上手用起来

整套方法一张便利贴就写得下:三行——主体与瞬间、光线、意图——把风格交给 Agent,用迭代替代整段重生成。概念原画工坊 正是为此而造:它在服务端带着一套 3A 美术部门级别的风格 DNA,因此你的 brief 始终短小,而每一张环境、载具、生物设定图,看起来都像出自同一支团队。

给它三行,让 Agent 撑起观感。

在概念原画工坊里 brief 一个镜头

常见问题

AI 出图还需要写又长又细的提示词吗?

不需要——目标不是长度,而是决策。一份写清主体与瞬间、光线、意图的三行 brief,能给模型的信息远多于一大堆关键词。在 Agent 上还能更短,因为风格(媒介、调色、画质底线)驻留在服务端,会被加进每一次请求。

为什么不该加「8k、电影感、大师之作」这类标签?

这些是从搜索借来的排序标签,而图像模型在构图、不在排序。画质词描述不了任何场景,模型只会把它们平均成千篇一律的结果。用一个真实的光线方向和一句明确的意图替换它们,把画质底线交给 Agent。

给裸模型下指令和给图像 Agent 下指令有什么区别?

裸模型是一件空白乐器:媒介、打光、调色、画质每一次都得你说全。图像 Agent 在服务端带着一套风格 DNA,被拼进每一次请求,因此你只需 brief 那个镜头。这既让整个项目的输出保持一致,也让配方不会从你的提示词里泄漏出去。

不整段重生成,怎么修一张成图?

只改一个变量,让会话记忆在上一张图上迭代。给一条导演批注——「把太阳压低」「清掉前景」——而不是一份新 brief。在 ReelWand 上,2 小时会话窗口内的提示会编辑上一帧、而非重新生成,你就能留住已经对的部分。

怎么让整组图保持一致?

两个杠杆:Agent 的服务端风格 DNA 在每一次渲染里守住观感;知识层则把一份成文的品牌规则手册(配色、构图、宜忌规则)检索进每一次生成。两者叠加,无需你逐张重写规则,就能让整组图守住品牌。

立即体验

把它变成作品

62 个专精视觉 Agent,每一个都内置了本文所讲的手艺。挑一个,开始创作。

打开 ReelWand

继续阅读