Grok Imagine Image 2.0 功能与能力
xAI 的 Grok Imagine Image 2.0 把力气全花在了精度上。指令写成什么样,画面就出成什么样;文字先规划再渲染;改图时只动你圈出的那一块。一张成片定稿之后,还能重新排布成竖版封面、详情页头图这些你真正要发的尺寸。做电商图和海报的人对这种差别最敏感,因为这类活儿最怕细节跑偏。
目前它以 Quality Mode 的形式,在 grok.com/imagine 以及 Grok 的 iOS、Android 应用中全量开放,API 接口即将上线。
| 功能 | 作用 | 适用场景 |
|---|---|---|
| 严格遵循指令生成 | 复杂的多要素需求逐条照做 | 精准版面、明确美术方向 |
| 文字与版面规划 | 像设计师一样排字,小字也不糊 | 海报、信息图、包装设计 |
| 魔术棒与分割 | 只改你点选的那一块,其余不动 | 精修图片、产品替换 |
| 多参考图编辑 | 单次生成最多融合 5 张参考图 | 合成画面、风格迁移 |
| Smart Resize | 一张图重排成 9 种画面比例 | 投放物料、横幅、竖版封面 |
严格遵循指令生成
提示词里写清主体、版面、确切文字和光线,这四项都会照办。复杂的多要素需求因此常常一次就中。后面要做的多半是微调,而不是推倒重来。Image 2.0 的目标说白了很朴素:出的图要能直接拿去用,而这件事从吃透需求开始。
文字排版规划
多数图像模型是把字母当图形画出来的,Image 2.0 换了个做法。渲染之前,它会先定下字体层级和版面关系,顺序和设计师一样。所以教程图解、信息图、片头画面这类内容密集的东西结构立得住,小号文字也不会糊成一团。想让某句话精确落位,就用引号把它写出来,再交代它放在画面的哪里。
魔术棒、分割与背景移除
魔术棒点哪改哪,画面其余部分一动不动。要更细就交给分割功能,一件衣服、一个标签、一块材质表面,都能单独圈出来。背景移除直接把主体抠成透明底,拿去排版或者放进详情页都省事。真实的活儿本来就是改了又改,所以这里的编辑做到了区域级,而不是每次整张重来。
多参考图编辑
一张图管商品、一张图管风格、一张图管场景,单次生成最多能放进 5 张参考图。于是合成变成了写一句提示词的事,模型一次融合到位,不用你在设计软件里手动拼。它对输入的还原也够扎实,出图里的那件商品,客户一眼就能认出是你送进去的那一件。
Smart Resize
一张图,任意尺寸。选好比例,模型会重新排布内容去填满新画幅,而不是把原图裁掉一块。覆盖的比例有 9 种,从 1:2 竖版长图,到 9:16、方形、16:9,再到 2:1 宽幅横版。主视觉一旦定稿,一整套投放物料就此展开,概念不必重做。
模板与世界观搭建
常见的活儿都被打包成了模板:修图、产品换色、电商产品图、职业头像、图标、吉祥物、游戏素材、周边设计,起点全都配置好了,你把素材填进去就行。模型在多次生成之间还守得住同一种画风。所以世界观可以一张一张搭起来。角色、她待的地方、她随身带的道具分开生成,风格依然是一套的,攒齐了就能直接送进视频流程。
Grok Imagine Image 2.0 应用场景
文字能用的海报
标题、副标题和层级关系都写进提示词,海报就会照着排好版出来,文字一字不差。小字号的说明也立得住,不会化成一层纹理。

信息图与教程图解
步骤有编号,箭头指得准,说明文字读得清,内容再密也一目了然。流程图或者分步教程,一次生成就是完整结构。

商品图与详情页修图
点住标签、配色或者背景,改动就只发生在那一处。光照、阴影和其余画面全都留在原位,这正是详情页和商品目录能批量做下去的前提。

一张视觉,铺满所有版位
Smart Resize 把成片重排成竖版封面、横幅、方形帖子和宽屏幻灯片。每种画幅都是重新填内容,不是硬裁一刀,所以放到哪个版位都像专门排过版。

画风统一的世界观
角色、她所在的场景、她的道具,用不同提示词分开生成,画风却是一套的。这种一致性也带进后续编辑,设定集越扩越大,还是一眼认得出。

照片修复与职业头像
魔术棒精修加背景移除,再套一个头像模板,一张随手拍就能变成可交付的成片。编辑只落在你指定的地方,其他一概不碰。

如何充分发挥 Grok Imagine Image 2.0
Image 2.0 吃结构清晰的需求,也吃就地编辑的习惯。下面几条,大致决定了出图质量的上限:
- 写需求书,别写一句说明。主体、版面、确切文字、风格、光线,逐项交代。你给多少细节,它就照做多少。
- 画面上的文字一律加引号。引号里的内容会照原样渲染,海报、包装和标签最吃这一条。
- 版面要说结构,不要说感觉。与其写“一个好看的海报版面”,不如写“标题横跨上三分之一,商品在右下角,说明文字压在它下面”。
- 先点选,再改动。修已有的图时用魔术棒圈出区域,只描述这一处要变成什么样。
- 一次只改一处。范围明确的改动更稳,小步叠加也比一条笼统指令可控。
- 每张参考图都要有分工。最多 5 张,说清楚谁定主体、谁定风格、谁定场景。
- 先定稿,再铺尺寸。主视觉确认之后,再让 Smart Resize 排成小红书竖版封面、详情页头图这些实际要用的格式。
- 重复性的活儿直接开模板。头像、商品图和图标的流程都是配好的,省下的时间够你多试几版。
完整的能力清单与规格参数,请参阅 Grok Imagine Image 2.0 模型页面。
Grok Imagine Image 2.0 提示词指南
一条好的 Image 2.0 提示词,更像一份简短的设计需求书。模型会在动手渲染之前先规划文字和版面,所以你的任务是给它足够的规划依据:画面里有什么、怎么摆、文字写什么、光从哪来。
| 要素 | 说明 | 示例 |
|---|---|---|
| 主体 | 画面里是谁或什么,写具体 | 亚麻布上的一只陶瓷茶壶 |
| 版面 | 元素放在哪、彼此什么关系 | 商品居中,底部一条说明文字带 |
| 确切文字 | 画面上要出现的字,用引号写出 | 标签写着‘HARVEST NO. 3’ |
| 风格 | 媒介、色调与氛围 | 扁平编辑插画风,低饱和绿 |
| 光线 | 光的方向与质感 | 从左侧照进来的柔和窗光 |
一个完整示例:
一张柠檬黄油酥饼的食谱卡。标题 "LEMON SHORTBREAD" 用衬线字体横跨顶部,
左侧自上而下五个编号步骤,各配一句短说明,右下角放一张成品饼干照片。
米色背景,细线分隔,光线柔和均匀。扁平、干净,适合直接打印。
编辑类提示词
编辑是一条范围明确的指令,不是重写一份需求书。先用魔术棒或分割功能选中区域,再只说这一处要改成什么,顺带交代哪些保持原样。比如给家具详情页换个面料颜色:
把扶手椅的软包面料换成森林绿灯芯绒。光线、阴影、地板以及其余部分
全部保持原样。
模型对已有画面的保留度很高,所以分寸掌握在你手上。一个区域,一处改动,其余自动延续。与其把五处修改塞进一条指令,不如拆成一串小编辑,中途每一版都还能用。
多参考图提示词
最多 5 张参考图。与其让模型自己猜,不如给每张派个活。做详情页主图时,分工大致是这样:
图 1 是商品:形状、标签、颜色都保持不变。
图 2 定风格:沿用它的色调和颗粒感。
图 3 是场景:把商品摆到这张台面上,用同样的光线。
起作用的正是这种分工。没派活的参考图,会把自己的背景、色调和构图一起带进结果;派了活的,只交出你要的那一项。
Smart Resize 工作流程
把调整尺寸放到最后一步,先定稿再适配,往往事半功倍。主视觉按你设计时的比例生成并改到位,确认之后再排成要发的每一种格式。每换一次比例,记得回头看一眼文字。模型会重新规划版面来填满新画幅,16:9 里并排的两块内容,到 9:16 竖版可能就叠成了上下结构。这种重排本来就是它该干的事,只是标题的位置值得在导出前再确认一次。
弱提示词与强提示词
版面、确切文字和编辑范围,自己写死,别留给模型猜。
| 重点 | 弱 | 强 |
|---|---|---|
| 文字排版 | 一张爵士之夜的海报 | 一张爵士之夜海报,标题‘BLUE HOURS’用宽衬线字体居中排在顶部,下方一行小型大写字母写明日期与地点 |
| 编辑范围 | 让这张照片好看点 | 只提亮人物脸部,背景的曝光和色彩保持不变 |
| 参考图 | 用这几张图 | 图 1 是要保持原样的外套,图 2 定姿势和取景,图 3 定色调 |
常见错误
- 文字指令太含糊:确切的字要用引号写出来,否则模型会自己编一句。
- 该编辑却整张重生成:全图重来,会丢掉魔术棒本可以保住的构图。
- 参考图没有分工:5 张图各自为政,结果就是一团混色;分了工才谈得上合成。
- 改动堆在一条指令里:“标签、背景、光线一起改”,换来的是三处都没改好。一次只锁一处。
- 没定稿就调尺寸:先把主视觉改完,再铺开其他格式,否则重排的只是一版还在改的草稿。

