

文章介绍AI图片Skill如何通过预设设计规则(如留白比例、材质处理、信息删减等)将普通甚至低质照片转化为具有杂志感、纸张拼贴质感的视觉海报,重点解析其在Codex等Agent平台上的工作逻辑,并探讨Skill作为可复用审美约束对降低设计门槛、推动审美平权的意义与局限。
一张普通的风景、宠物或者随手拍,经过重新裁切和排版,却变成了带有纸张、拼贴、留白和杂志感的海报。
相信你也在小红书刷到过不少类似的内容,照片本身可能并不特别,甚至算得上是一张「废片」。
通过一些特别的生图 skill,似乎能化腐朽为神奇。

看多了之后,我也有点手痒了。
从相册里翻出一张在横道河子拍的照片。
黄黑相间的限高架、积雪中的行人,还有远处的房屋和山,让画面有几分氛围,但电线、建筑和路牌挤在一起,始终缺少一个明确的视觉重点。
按照以往的习惯,这张照片大概会继续躺在相册角落。
这一次,我把它直接拖进了 Codex 的图片 Skill。

左|原图 右|Skill 生成
十几秒钟后,一张海报出现在屏幕上。
原本彩色的街景被处理成版画的质感,房屋、山和电线退到背景里,右侧的游客、路边摊和前景杂物则被直接舍弃,黄黑限高架成为画面里唯一醒目的颜色。剩下的画面,变成了带有纤维纹理的米白色纸面,以及加上小字排版点缀。
原来信息密集的雪乡街景,就这样被重新做成了一张很安静的纸刊海报。
Skill 本质上是运行在 Codex 这类 Agent 平台上的一份「工作流契约」。
放到图片生成里,意思就更直观了:你负责提供原图,Skill 则规定这张图应该怎样被重新设计——使用什么构图、选择什么底色、保留哪些元素、文字放在哪里,以及最后以什么方式生成和检查。
它有点像一位设计师在模型耳边不断提醒:这里应该留白,那里只能保留一种强调色,这部分不要照搬原图,那部分又必须保持真实。只不过,这些原本依赖设计师临场判断的选择,现在被写成了一套可以重复调用的规则。
为了看看不同 Skill 会怎样理解同一张照片,我又换了另一套偏纸张拼贴的 Skill

相对第一个 Skill,它保留了原图下半部分的更多细节——雪地、房屋、游客、路边摊和限高架仍然按原图保留,而变化主要发生在画面上半部分。
原来的蓝天被换成了米白纸面,部分元素则被重新画成较浅的线稿。中间再用一条不规则的撕纸边缘,把真实照片和手绘区域连接起来。
这也说明,Skill 并不只是给图片套上一个固定滤镜。它真正决定的,是模型应该怎样理解原图,以及面对复杂画面时,究竟选择删除、保留,还是重新组织。
我继续往相册里翻,专门挑了几张随手拍的照片,想看看图片 Skill 能不能替它们找到一种合适的呈现方式,也顺便和大家分享几套风格不同的 Skill。
使用方法并不复杂:
打开 Codex,把 Skill 的 GitHub 链接发给它并完成安装。之后只需要上传照片、调用对应的 Skill,剩下的就是等待 AI 生成结果。
下面我也会附上每套 Skill 对应的 GitHub 链接,感兴趣的话可以直接安装试试。

https://github.com/LiamGvchi/gc-minimal-zine-poster

https://github.com/Zeejay0/gathered-scenes-zine-skill

https://github.com/Hchen1218/heytea-style

https://github.com/ZzzLc0405/photo-abstract-editorial
不同 Skill 处理照片的方式并不相同,也不是每张「废片」都能因此变成完美作品。换一种形式,它们至少有机会从相册角落里重新被看见。
为了看看同一套 Skill 放到不同 Agent 里会发生什么,我又把这两个 Skill 分别交给 GPT 聊天版和

左一、二|GPT 生成 右一、二|
至少在这次测试中,GPT 的整体完成度更高。它能够理解 Skill 规定的基本形态:大面积留白、纸张肌理、单一强调色,以及真实照片与拼贴区域之间的关系。
它的理解更多停留在整体视觉形式上。它没有像 Codex 那样,把原图里的限高架、人物、房屋和电线分别提取出来,最终得到的更像是把整张照片放进一套已经理解好的版式中。
这种差异也揭示了 Skill 的作用边界:它给出的是一组仍需 Agent 理解和执行的设计规则,最终画面会因 Agent 的解读而有所不同。
要弄清这些规则如何影响最终画面,我认为还需要回到 Skill 本身。
在打开图片 Skill 的目录后,我发现里面只有SKILL.md 、说明文档和几张示例图,没有负责抠图、裁切或排版的程序。那些看起来像经过 Photoshop 逐层处理的效果,并不是由代码一步步执行出来的。
Skill 真正做的,是另一件事:先替模型完成一轮设计决策,再把这些决定写进 Prompt,交给图像模型去生成。

这些图片为什么会让人觉得有审美、有质感?
把 Skill 文件夹完整拆开看了一遍,我发现真正重要的,不只是它选择了哪些设计元素,还在于它怎样规定这些元素出现的位置、比例和关系。
它做的第一件事,不是美化照片,而是删减信息。
「不要复述所有信息,只留下一个可以被画出来的中心概念。」
放到这张雪地街景里,原图其实包含很多东西:房屋、摊位、游客、电线、雪路和铁路设施。但 Skill 没有尝试把这些内容全部搬进海报,而是把它压缩成了一个更简单的画面——限高架下,几位行人在冬天缓慢经过。
这一步看起来只是总结,实际上已经完成了第一次审美判断。因为从这一刻开始,哪些东西应该成为主角,哪些东西可以被删除,已经有了明确方向。
留白,是让画面获得呼吸感和质感的关键。Skill 对留白和主体的比例作出了非常具体的规定:
「画面中 70%—90% 应该是空白纸面,主要视觉簇只占大约 8%—25%。」
这个悬殊的比例,让小小的主体在大面积空白中获得了重量,也让原本拥挤的画面有了喘息的空间。
而最直观的质感体现来自于画面的材质的呈现。 Skill 的原文中,它对主体的材质处理也作出了明确规定:
「灰度照片和纸张碎片可以使用低对比度、复印柔化、撕裂边缘、半调网点、扫描线、Riso 印刷颗粒、复印磨损、油墨渗出或轻微套色错位。」
不过,这些材质并不会在每次生成时全部叠加。文件夹 里还有一套名为Variation Engine的「变化引擎」,可以理解为一个预设的视觉配方库。
确定核心概念后,模型会从几个维度中各选一种方案,再组合成完整的视觉配方。比如,构图可以是中央碎片或异形撕纸,质感则可以选择复印柔化、Riso 颗粒或扫描噪点。通过这些上述这些元素的组合生成 Prompt。
这种组合并不是程序通过随机完成的,也没有固定种子。最终选择哪套配方,仍然由模型根据当前内容和前面的生成记录决定。因此,它更像一种带有上下文记忆的「受控随机」。

更有意思的是,这个 Skill 花了相当多篇幅告诉模型「不要做什么」。
不要让主体或场景铺满整个画面,不要使用商业海报式的大标题层级,不要加入产品广告布局、Logo、CTA 和品牌宣传感。除此之外,它还明确排除了光面样机、电影感光照、3D 渲染、霓虹和赛博朋克这些模型最常用的视觉套路。
它不仅在规定自己要形成怎样的审美,也在不断阻止模型滑向那些最常见、最省事的商业模板。

Skill 的核心,其实是「约束」。
来到这会发现,我们常常评判一个图片「有质感、有审美」,往往是出于一种感性的认知。而 Skill 却正正相反,他把「美」拆分成主体应该多大、画面应该留多少空白、颜色怎样出现。
换句话说,制作 Skill,就是把个人审美整理成一套可以重复执行的选择和边界。它不能保证每次都生成同样的结果,却能让模型始终在一个相对稳定的审美范围内变化。
过去,想把一张普通照片做成海报,你需要理解构图、配色和排版,还得会抠图、调色,熟悉各种设计工具。
现在,这些经验被提前写进了 Skill:哪里应该留白,主体要放多大,背景使用什么材质,颜色控制在几种以内,甚至哪些东西不该出现在画面里,都有人替你做了第一轮判断。
当我们审视生图 Skill 带来的真实价值,或许在于降低了把审美落实为作品的门槛。

如果把这种变化称为「审美平权」,那么平权的核心在于每个人都能更平等地接触、调用和实现一种成熟审美。普通人从一套相对成熟的审美方案出发就能开始创作,无需先成为设计师。
得到一张好看的图片,并不意味着一个人的审美也随之提高了。每一个 Skill 背后,都有作者预先划定的边界:什么颜色更协调,哪里应该留白,主体应该如何摆放,什么样的画面才算「高级」。用户调用 Skill,实际上是在使用作者已经做好的判断。
Skill 可以是审美训练的起点。
如果只是上传照片、接受结果,那么得到的仍然是一套借来的审美。Skill 开放了成熟审美的使用权,却没有自动把审美的定义权交给用户。
而能否在实践中比较和修改,了解为什么这张构图更好,为什么少一个色块更舒服——只有当人开始选择、拒绝、调整,借来的方法才可能长成自己的审美判断。
看见边界,只是理解一种审美;能够选择、改写甚至推翻这些边界,才是在形成自己的审美。
即使这样,我还是愿意把图片 Skill 的普及看作一件好事。
它让更多人获得了表达和创作的机会,也让设计经验第一次能够像工作流程一样被保存、分享和调用。但工具解决的是执行,不能替人完成最后的判断。当生成本身不再稀缺,真正拉开差距的,反而是谁知道该选择什么、修改什么,以及什么时候应该停下来。
Skill 让「做得像样」变得便宜,却没有让「做得像自己」变得容易。
本文来自微信公众号“爱范儿”(ID:ifanr),作者:方俊鸣,编辑:肖钦鹏