马斯克的新生图模型,让我笑了一整晚

AITNT-国内领先的一站式人工智能新闻资讯网站
# 热门搜索 #
马斯克的新生图模型,让我笑了一整晚
9573点击    2026-08-17 09:44

毫无疑问,四月份发布的生图模型 GPT-Image-2,现在依然是当之无愧的 AI 生图之王。


无论是各种复杂的信息图,还有普通用户用来做一些简单的 PS,到处都有 GPT-Image-2 的痕迹。


一般的生图模型想要突出重围,光拼质量肯定不够。这几天,马斯克在 X 上疯狂推广的 Imagine Image 2.0 就凭借着能做表情包出圈了。


马斯克的新生图模型,让我笑了一整晚


这款新的生图模型,在大模型竞技场上,文本转图像生成和图像编辑两个类别均位列世界第二。


马斯克的新生图模型,让我笑了一整晚


除了老生常态的用 AI 生成各种文字密集的信息图、广告、游戏素材、UI/UX 模型、故事板等等,Imagine Image 2.0 这次的重点是支持可交互的精准编辑。


马斯克的新生图模型,让我笑了一整晚


上传一张图片,Grok 会自动将图片进行分层,我们可以精确选择图像中的特定区域进行修改。


就像这张维基百科的表情包,Grok 分析之后的分段包括地球的每一块碎片,以及下面举着地球的任务,也被分成了仅人脸和包含手势动作两个图层。


马斯克的新生图模型,让我笑了一整晚


而点击图层右侧的下载按钮,就可以直接将图片中的任意主体导出为透明背景。此外,魔棒工具可以编辑我们涂画的区域,做到自动分层覆盖不了的区域。


多张图片的编辑融合,Imagine Image 2.0 也能做到,多参考编辑功能一次最多可处理 5 张输入图像,实现自动拼接。


马斯克的新生图模型,让我笑了一整晚


🔗 体验地址:

https://grok.com/imagine


万物皆可表情包


打开 Imageine 官网,输入单张或多张图片,简单描述需求,生成之后我们就能来到照片的编辑页面。


马斯克的新生图模型,让我笑了一整晚


在右侧边栏,从上到下依次是 Imagine Image 2 自动识别去除背景之后的照片分层,像这张图片分成红色夹克、白色 T 恤、AI 公司 Logo 等元素。


我们可以直接点击对应的元素进行修改,不过这个时候只能输入提示词,而不能再引用其他的信息,所以这将非常依赖模型的世界知识能力。


往下是精确编辑,如果在选区中没有自动识别到对应的元素,通过精确编辑,我们可以将框选的物体作为选区的一部分,也可以直接用提示词进行修改。


马斯克的新生图模型,让我笑了一整晚

可以直接添加到选区


有了这些精准编辑的能力,我们就可以快速地编辑一个已有的表情包为自己所用。


例如这张经典的分心男友,可以直接编辑不同的选区,然后替换或增加对应的内容。


马斯克的新生图模型,让我笑了一整晚


还有会议室白板图,每一个对话框都会被自动识别成选取,我们只需要选择对应的气泡框,然后要求它填入文字,就能得到一个纵向的漫画 Meme 图。


马斯克的新生图模型,让我笑了一整晚


分层编辑的能力确实让 Imagine Image 2.0 和 GPT-Image 2 有点不同,相较于 GPT Image 2 生成中全部靠提示词来控制,或者点选评论,Grok 的图像生成在交互方面确实更加友好。


但也有网友说,Imagine Image 2.0 越来越难用,严格的审核机制,什么也做不了。


我们上传一些蜘蛛侠的照片,也会被提示「无法生成可能包含受版权保护的内容。」更不用说,各种各样的擦边图,现在也有了更强的护栏。


更能打的 GPT-Image-2.5 来了?


而这几天社交媒体上除了 Imagine Image 2.0 的消息,在大模型竞技场上,开始出现了 OpenAI 的新版生图模型。


有网友发现 OpenAI 正在测试 GPT-Image 2 的后续版本,在 Arena 上以 mona-lisa-1 的代号进行测试。


马斯克的新生图模型,让我笑了一整晚


随机测试到该模型的网友认为新版本的 GPT-Image 2.0 在真实感和噪声方面略有改进,但整体的提升幅度不大。


也有网友说新模型在真实感上,减少了大部分的 AI Slop 感,几乎每次生成的照片都更加真实。下面三张图片从左到右依次是 GPT Image 2.0 High 思考模式,Medium 中度思考模式,以及大模型竞技场上的 mona-lisa-1 模型。


可以看到中度思考模式下的广告牌,一眼就能看出来是 AI 生成;而 High 模型和 mona-lisa-1 在整体上则更有手机拍摄的感觉。


马斯克的新生图模型,让我笑了一整晚

提示词:当代纽约街景,一辆停在路边的汽车,清晰可见逼真的品牌标识和车牌(车牌号:432 JKL W6),真实的店面、招牌、人行道、交通细节以及日常的城市杂物。照片采用 iPhone 后置摄像头拍摄,自然光,曝光真实,略带手持拍摄的模糊效果,轻微的传感器噪点,未经任何后期处理,色彩自然,无电影级调色,无影棚灯光,无电脑特效,无人工锐化。 左上角的广告牌上有一则标题为“你怎么看?”的广告,其中引用了一句话,@WolfRiccardo 以及 ChatGPT 的标志和一张黑豹头像。


这种手机拍摄的效果,最近也有网友发现了 GPT-Image-2 的新玩法,给它发送一段提示词


「GPT你陪我一段时间了,我想看看你的样子 请生成一张类似你自己用iPhone随手自拍的 照片没有明确主题,没有刻意构图,只是很 普通,甚至有点失败的快照照片,略带运动 模糊,光线不均,轻微曝光,过度角度尴尬, 构图混乱,整体呈现出一种过于真实的随手 一拍感,就像是从口袋里拿出手机不小心按 到的自拍」


ChatGPT 就会根据保存的记忆信息,生成一张真实满满的自拍照片。


马斯克的新生图模型,让我笑了一整晚

再感受一下豆包


为了确定 mona-lisa-1 就是 OpenAI 的新模型,有网友直接拿 mona-lisa-1 生成的图片放到 OpenAI 验证工具中,根据验证工具显示的结果,上传的图片包含 OpenAI SynthID 水印。


马斯克的新生图模型,让我笑了一整晚


我们也拿那张街头广告牌的照片上传到 OpenAI 验证工具,同样显示「此内容是由 OpenAI 生成。」


马斯克的新生图模型,让我笑了一整晚

OpenAI 验证平台:https://openai.com/zh-Hans-CN/research/verify/


不过,当我们在大模型竞技场中测试时,进行了好几轮的生成,都没有出现这个叫做「蒙娜丽莎 1 号」的模型。


网友的测试发现 mona-lisa-1 模型的知识只包含到 2025 年 5 月 22 日。当被要求模型画出 Anthropic 的发布记录时,从 Opus 4 之后的模型时间线,几乎就都是错乱的。


马斯克的新生图模型,让我笑了一整晚


因此也有网友说这可能是 OpenAI 即将推出的 GPT-Image 2.0 Mini 模型,又或者是 OpenAI 的开源生图模型。


无论是 2.5 还是 2.0 Mini,在 2.0 如此能打的当下,能看到生图模型还有值得研究的空间确实很难得。


看厌了满大街的信息图,偶尔被一点 midjourney 生成的中国仙境所震撼,从一致性保持、密集文字、精准编辑到美学品质,我们还可以期待些什么样的 AI 生图呢。


文章来自于"APPSO",作者 "APPSO"。

AI转型,免费服务,就找AITNT
AITNT资源拓展
根据文章内容,系统为您匹配了更有价值的资源信息。内容由AI生成,仅供参考
1
AI漫画

【开源免费】ai-comic-factory是一个利用AI生成漫画的创作工具。该项目通过大语言模型和扩散模型的组合使用,可以让没有任何绘画基础的用户完成属于自己的漫画创作。

项目地址:https://github.com/jbilcke-hf/ai-comic-factory?tab=readme-ov-file

在线使用:https://aicomicfactory.app/

2
prompt

【开源免费】LangGPT 是一个通过结构化和模板化的方法,编写高质量的AI提示词的开源项目。它可以让任何非专业的用户轻松创建高水平的提示词,进而高质量的帮助用户通过AI解决问题。

项目地址:https://github.com/langgptai/LangGPT/blob/main/README_zh.md

在线使用:https://kimi.moonshot.cn/kimiplus/conpg00t7lagbbsfqkq0