ARTICLE DETAIL

资讯详情

深耕网站建设、视觉设计与SEO优化的一线实战洞察。

图层,而不是像素:当AI设计工具学会像设计师一样思考

图层,而不是像素:当AI设计工具学会像设计师一样思考 你有没有想过为什么用AI生成的海报图你想把里面那只兔子挪个位置几乎是不可能的事你打开PS想改一张设计稿里的文字鼠标一点那个文字层立刻被选中可以拖动、可以改颜色、可以删除背后的背景图完好无损。这是因为设计师从一开始就是按图层工作的背景、主体、装饰、文字各自待在自己的层里互不干扰。但AI生成的图片不是这样。主流的文本生成图像模型不管是Midjourney还是Stable Diffusion吐出来的都是一张扁平的画布。像素排列得再精美它们描述的也只是这个位置该是什么颜色而不是这个区域是一只兔子那个区域是月亮它们之间有前后遮挡关系。你想单独挑出那只兔子挪个位置模型根本不知道兔子这个概念在图里对应哪些像素、被谁挡住了多少、挪走之后露出的应该是什么内容。这就是这篇论文要解决的核心矛盾生成模型很擅长画出来却完全不懂怎么拼出来的。像素记录的是结果图层记录的是过程先说清楚这两者的区别有多大。像素*图像最基础的单位每个像素记录一个颜色值描述的是画面看起来是什么样而不涉及内容的语义结构。一张扁平化的PNG图本质上就是几百万个像素点按顺序排列。它可以告诉你这个位置是红色但没法告诉你这个红色区域是一件衣服更没法告诉你这件衣服被一个人的手臂遮住了一部分如果把手臂拿掉衣服应该是完整的一件。而设计师工作时脑子里想的完全是另一套逻辑这是背景层这是主体人物层这是装饰元素层这是文字层每一层都是一个独立的、完整的、可以单独操作的对象。这就是这篇论文提出的核心洞察用论文里的话说像素定义了图像如何被渲染而图层定义了图像如何被创造、理解和编辑。这句话听起来有点抽象换个说法可能更好懂:一张扁平的图片就像一份直接端上桌的成品菜,你尝得出味道,但看不出用了哪几种食材、哪个步骤先放盐哪个步骤后放糖。而一份带图层的设计稿更像是厨房里没洗的备菜台,葱姜蒜、肉、调料分门别类摆着,你随时可以单独拿起某一份重新处理,而不影响其他部分。如果所有食材直接混合下锅端上桌(也就是只有扁平像素),你想单独把里面的姜丝挑出来重新切一遍,基本没有可能。于是研究团队提出了一个叫UniWorld-Design的框架核心思路就是把语义化的RGBA图层作为生成、理解、编辑这三件事的最小单位。RGBA*一种图像表示方式除了常见的红绿蓝三个颜色通道RGB额外增加一个Alpha通道用来表示每个像素的透明度从而支持抠图式的图层叠加。这个框架里有两个模型。一个叫T2RGBA文本生成透明素材另一个叫I2L图片拆解为图层。这两个模型合起来构成了一个从文字到图片、再从图片拆回可编辑图层的完整循环。从零开始造一个透明素材T2RGBA先看第一个模型T2RGBA全称Text-to-RGBA。它做的事情很直接给一句话描述比如一只戴着水手帽的绿松石色鲸鱼直接生成一张带透明背景的RGBA图片而不是一张需要你再去抠图的普通照片。这里有个技术上的巧妙之处。研究团队没有从零训练一个全新的模型来处理透明通道而是在已有的图像自编码器基础上做了个微创手术。自编码器VAE*一种能把图片压缩成一小段数字编码再从编码还原回图片的神经网络结构是几乎所有主流图像生成模型的底层组件。具体做法是把编码器最开始那一层和解码器最后那一层从处理三个颜色通道RGB扩展成处理四个通道RGBA。原来的RGB权重原样复制过来新增的透明度通道的权重先设成零解码器的透明度偏置项设成完全不透明。这样一来改造完的模型起步状态就等同于原来的RGB模型只是多了一个默认全不透明的透明度通道之后再通过训练慢慢学会怎么正确地处理透明区域。如果不这样做,直接从零训练一个RGBA模型会怎样?那意味着要放弃原来RGB模型已经学到的所有关于物体轮廓、光影质感的知识,相当于让一个已经会画画的人重新从拿笔开始学,浪费了大量已有的能力积累。而这种渐进改造的方式,更像是给一辆已经会开的车加装一个新功能模块,而不是把整辆车拆了重新造。训练数据方面团队用的是内部整理的一批文字配透明图的数据集包括设计素材、抠好的主体图、矢量画转成的插画。透明图片占了训练数据的大多数但也混入了一部分不透明的图片防止模型忘了怎么处理正常图像。训练完成之后模型还要经历一套两阶段的优化流程先做渐进式蒸馏来提速再用一种叫DiffusionNFT的方法做强化训练来提质。这个流程我们后面统一讲因为I2L也用了同一套。在CLIP Score一种衡量生成图像和文字描述匹配程度的指标这个维度上T2RGBA达到了33.03分是所有对比模型里最高的比LayerDiffuse高了13%比OmniAlpha高了6.5%。不过在FID衡量生成图和真实图分布相似度和白底合成后的LPIPS衡量图像细节相似度这两个指标上OmniAlpha表现更好。这说明T2RGBA更擅长听懂你说的话但在细节质感上还有提升空间。拆解一张成品图I2L怎么做到拆得干净还能用第二个模型是整篇论文里更硬核的部分叫I2LImage-to-Layer。它接收一张已经画好的成品图加上一句全局指令比如把这张图拆成背景、元素和文字再加上针对每一层的具体描述然后同时输出一组排好顺序的、完整的语义图层。这里的关键词是完整。多数现有的分割方法做的是可见像素分割也就是只把画面上肉眼看得见的部分抠出来。这样做有个大问题如果你把某个遮挡物挪走被遮住的地方就露出一个透明的洞因为模型压根没学过那块被遮住的区域应该是什么样。I2L要解决的正是这个问题。它学的不是哪里能看见什么而是这个物体完整的样子是什么即便这个物体有一部分被别的东西挡住了。论文管这个叫语义完整图层而不是可见像素分区。打个比方,这就像给一栋房子拍照和给房子画建筑图纸的区别。拍照只能记录你镜头前看到的那一面墙,墙后面藏着什么完全不知道;而建筑图纸会把每一层楼、每一根承重柱的完整结构都画出来,哪怕现在被墙面装饰挡住了。等你哪天想拆掉一面墙看看内部结构,有图纸的房子随时能查,只有照片的房子就只能瞎猜。如果I2L也只学可见分割这一套,那么用户挪走一个遮挡物之后,看到的就永远是一个不明不白的透明窟窿。要实现这个目标光靠数据和模型规模堆不出来还得解决两个结构性的对应难题。第一个难题是每一句针对某一层的描述必须精确控制住它对应的那一层而不能影响到整个图层堆栈的其他部分。第二个难题是不同图层的图像token模型内部表示图像信息的基本单元必须共享同一个画布坐标系同时又要保持各自独立的身份和先后顺序。Token*模型处理信息时切分出的最小单元图像token对应图片中的一小块区域文本token对应一个词或字。为了解决这两个问题研究团队设计了一套叫LIB-MMDiTLayer–Instruction Binding MMDiT的架构中文可以理解为图层指令绑定的多模态扩散Transformer。它包含两个机制。第一个叫图层指令绑定注意力做法是给全局指令和整张输入图打上标签-1给每一层专属的描述和对应的图层图像打上编号ii是第几层。这样某一层的图像在读取文字信息时只能读到全局指令和自己专属的描述读不到别的层的描述。但图像和图像之间的关注是完全开放的这样才能让所有图层共同判断彼此的遮挡和堆叠关系。第二个机制叫图层索引的三维旋转位置编码简单说就是给每个图像token除了原本的行、列坐标再加一个层号坐标让模型知道同样位置的一个点在不同图层里是同一个画布位置但属于不同的层。这套设计的效果从数据上看很明显。在Crello这个基准测试集上I2L和目前另一个先进模型Qwen-Image-Layered对比在每层RGB内容的还原误差上降低了37%从0.2014降到0.1264在透明度区域的匹配精度Alpha Soft IoU上提升了34%从0.5454提升到0.7325。| 方法 | RGB L1误差越低越好 | Alpha Soft IoU越高越好 ||---|---|---|| Qwen-Image-Layered4层 | 0.2014 | 0.5454 || **UniWorld-I2L4层** | **0.1264** | **0.7325** |在可编辑性指标上I2L生成的空白图层比例下降了63%从0.35降到0.13糊状半透明层那种既不干净也不能单独用的层从1.34降到1.19。| 方法 | 坏图层数量 | 空白层 | 糊状层 | 内容差异度 ||---|---|---|---|---|| Qwen-Image-Layered4层 | 1.69占42.3% | 0.35 | 1.34 | 0.658 || **UniWorld-I2L4层** | **1.32占33.0%** | **0.13** | **1.19** | **0.690** |还有一组用大语言模型VLM打分的评测从五个维度给拆解结果评分满分25分。I2L拿到20.43分Qwen-Image-Layered拿到17.60分。在这五个维度里I2L在语义分离度、背景修补、内容分布、内容有效性这四项上都更强唯独在Alpha清洁度也就是透明边缘是否干净没有色彩残留和光晕上略逊一筹2.90对3.33。论文也坦诚承认了这一点把边缘处理和密集文字识别列为当前的主要局限。拆完还能再拆一次指令驱动的递归分解I2L不只是拆一次就完事它支持一种叫指令可寻址的操作方式。具体来说有三种玩法。第一种叫顶层分解就是把一张完整图片按你说的语义类别拆成几层比如背景、主体、设计元素、文字。第二种叫递归分解也就是把拆出来的某一层再拿去当输入进一步细分。比如第一轮拆出了主体这一层里面其实包含了一个人和一只鹦鹉第二轮就可以再拆一次把人和鹦鹉分开。第三种叫目标提取直接告诉模型我只要这几个特定元素单独成层剩下的合并成一层。论文里给了大量的实际案例比如输入一张写着中秋字样的月亮海报第一轮指令是把这张图拆成背景、元素和文字第二轮再指定把左下角的树、右上角的月亮、屋顶上的兔子分别单独提取出来。模型能连续两轮准确响应输出的每一层都保持位置对齐、透明度正确。这个能力为什么重要因为它把拆图层变成了一个可以被外部智能体比如自动化设计流水线里的AI助手调用的工具而不是一个死板的固定流程。一个多模态智能体可以按需决定这次要拆多细、这次要单独抠出哪个东西然后把结果交给别的编辑工具去处理处理完再合成回去。论文里配的一张流程图讲得很清楚一个纯像素接口只能把图片扔给智能体智能体拿到手还得自己想办法猜图里有什么结构而图层原生的接口直接把一组持久化的、可以单独操作的对象状态摆在智能体面前它可以直接调用生成、拆解、编辑、合成这几个工具像搭积木一样组织整个设计流程。这就好比你去五金店买一套现成的标准化螺丝钉和螺母(图层原生接口),和你去矿场挖一块原始矿石回来自己冶炼、切割、打磨(纯像素接口)。后者理论上也能造出同样的东西但每一步都要重新发明轮子。如果没有这套标准化的图层接口每个想做AI辅助设计的团队都得自己再造一遍怎么从一张图里认出物体边界这轮子。训练数据从哪来不能用AI生成的图自己训练自己这一部分其实是整篇论文里我觉得最实在的一段。研究团队面临一个逻辑上的死循环如果想让I2L学会完整图层包括被遮挡的隐藏内容那训练数据本身就得包含这些隐藏内容的真实样子。但如果用AI生成的图层来构造训练数据那些被遮挡的内容也是AI编造出来的模型学到的东西无非是继承了生成器本身的偏见和局限越训练越像在拿自己的影子训练自己。所以团队选择了一条更笨但更扎实的路直接用设计师亲手做的PSD文件。PSD*Photoshop的专属文件格式保存了一份设计作品里所有独立图层的原始信息包括被其他图层遮挡的部分。PSD文件里被遮挡的图层内容其实一直都完整保存在文件里只是最终导出成图片时被盖住了看不见。这就相当于拿到了标准答案不需要靠模型去猜测被遮挡的部分应该是什么。具体流程是先把PSD里的图层渲染出来用一个视觉语言模型辅助把相关的图层归并成有意义的语义组比如把眼睛鼻子嘴巴这几个零散图层合并成人脸再组织成一个树状的层级结构。注意视觉语言模型只负责分组建议所有实际的像素内容都直接来自原始PSD文件不会被AI二次生成污染。这棵树建好之后一份PSD文档就能自动衍生出三种训练样本树的根节点对应顶层分解任务树的中间节点对应递归分解任务选中某些节点加上剩余部分则对应目标提取任务。一份素材喂养三种能力这个设计相当聪明省了不少数据标注的功夫。让模型跑得快一点蒸馏与强化学习一个模型光是效果好还不够如果推理速度慢到没法用那价值也大打折扣。I2L要在一次推理中同时输出好几层完整分辨率的图像这天然就会让计算序列变得很长推理成本随之飙升。为了压缩这个成本团队用了一套两阶段的后训练流程。第一阶段叫渐进式蒸馏用一个学生模型去学习一个更慢但更精确的教师模型的行为目标是把原本需要很多步才能完成的生成过程压缩到八步就能搞定。这个过程借鉴了SDXL-Lightning的渐进对抗蒸馏思路还额外加入了一个判别器专门用来区分这是教师模型真实生成的终点还是这是学生模型模仿出来的终点防止蒸馏后的模型输出变得过度模糊平滑。团队还试过另一种叫分布匹配蒸馏的技术方案但发现效果不理想:透明度会莫名其妙变得都很不透明颜色内容和透明度掩码对不齐跟着指令的能力和图层之间的一致性也变弱了。这段坦诚的失败尝试记录挺难得说明研究团队确实是踩过坑之后才选定现在这套方案的。第二阶段是用一种叫DiffusionNFT的强化学习方法做后训练目的是针对具体任务再打磨输出质量。DiffusionNFT*一种基于扩散模型的强化学习后训练方法核心思路是给模型生成的样本打一个好坏分数分数高的样本被进一步强化分数低的被反向修正。针对T2RGBA和I2L团队设计了不同的打分规则。T2RGBA用了三个打分器一个专门检查透明度是不是符合预期该透明的地方透明该不透明的地方不透明一个用CLIP式的方法算生成图和文字提示的语义相似度还有一个直接让一个大语言模型给生成结果打0到5分。这三个分数会先经过一层透明度是否正确的把关如果透明度本身就错了哪怕另外两项分数再高也没用相当于一个硬性门槛。I2L的打分规则更聚焦在图层还原精度上用逐像素的RGBA绝对误差加上一个感知相似度网络LPIPS的组合分数每一层单独算分再平均不搞跨层的连乘惯性。写在后面读完这篇论文最触动我的其实不是那些提升百分之几十的指标而是那个用PSD文件训练的决定。这背后藏着一个挺朴素但容易被忽略的道理想让AI学会某种完整性的认知你不能靠AI自己生成数据去教AI因为它没见过真正完整的东西它只会把自己的偏见传给下一代。这跟教育里言传不如身教有点像你想让模型学会处理被遮挡的隐藏内容就得先找到真正保存了这些隐藏内容的原始资料而不是让模型自己瞎猜然后拿猜测结果当教材。论文里还有个细节值得单独说一下:团队试过用分布匹配蒸馏来提速,结果发现透明度全变得不透明了,这个失败被坦率地写进了论文而不是藏起来。做研究的人大概都懂,这种我们试过A方案但它把颜色和透明度弄乱了,所以换成了B方案的记录,比一份只报喜不报忧的成功故事更有参考价值。如果这条路继续走下去下一步大概会是什么样子论文结尾提到团队接下来想把这套能力扩展到图层插入替换和多轮迭代编辑。那意味着有一天你也许可以直接跟AI说把这个人物往左移一点背景山换成海而AI真正理解的不再是一整张照片该怎么重画而是这句话到底指向了哪一层、该动哪块积木。QAQ1UniWorld-Design是什么AUniWorld-Design是一个把图像生成从画一整张图改成生成可编辑图层的框架核心是把带透明通道的RGBA图层当作生成、理解和编辑的最小单位包含T2RGBA文字生成透明素材和I2L图片拆解成图层两个模型。Q2I2L和普通的图像分割工具有什么区别A普通分割只能抠出画面上肉眼可见的部分被遮挡的地方会留下透明的洞I2L学的是完整的语义对象即使某个物体被遮挡了一部分拆解出来的图层依然是完整的挪走遮挡物后不会露馅。Q3这套技术训练时用的数据从哪里来A团队没有用AI生成的图层做训练数据而是直接使用设计师制作的PSD文件因为PSD里被遮挡的图层内容原本就完整保留着避免了用AI自己编造的内容训练AI导致的偏见传递问题。
返回列表