AI 为什么没有品味?用数学告诉你答案

AITNT-国内领先的一站式人工智能新闻资讯网站
# 热门搜索 #
AI 为什么没有品味?用数学告诉你答案
7235点击    2026-08-07 09:09

你有没有发现,现在用 AI 生成的东西越来越多,但看起来越来越像同一个人做的?配色方案大同小异,文案风格如出一辙,设计稿像是从同一个模板里批量跑出来的。这种感觉有个词,叫 AI slop(AI 垃圾内容)。最近我听了 Taste Labs 创始人 Thais Castello Branco 在 AI Engineer 大会上的一段分享,她花了将近二十分钟拆解这个问题的底层逻辑,我听完觉得这是我这段时间听到的最扎实的一次关于 AI 在主观领域为什么还不行的分析。


AI 为什么没有品味?用数学告诉你答案


Thais 创办 Taste Labs 的出发点很简单:AI 在编程和数学上已经相当厉害了,但在设计、创意写作、个性化表达、情感理解这些领域,还远远落后。她说,这不是一个努力程度的问题,而是一个根本性的方法论问题。要真正解决 AI slop,必须先搞清楚为什么主观领域这么难,然后找到把它拆解开来、变成可训练问题的路径。Taste Labs 现在同时服务两种客户:一方面跟顶尖的前沿实验室合作,帮他们评估和 benchmark 模型在主观域的表现,找到哪里断了、怎么修;另一方面跟 agent 和应用层的公司合作,处理那些她认为不应该在模型层解决、而应该通过上下文理解和用户意图来解决的问题。这个定位本身就挺有意思,说明她对这个问题的边界划得很清楚。


为什么代码能训练好,设计却不行——这是关于领域的事,不是关于模型的事


Thais 说了一句话我觉得特别值得停下来想一想。她说,我们经常把"模型很擅长写代码"当成是模型的一个特性来说,但其实这是代码本身的特性。代码是可以分解的,可以执行的,可以验证对错的。你写一段代码,跑一跑,报错了就是错了,通过了就是通过了,这个反馈信号干净、明确、可以直接用来训练。


但设计是什么?你让一个人看一个页面,问他好不好,他可能会说"感觉不太对",但说不清楚哪里不对。你换一个人来看,可能得到完全不同的判断。而且,什么是好设计这件事本身是随时间变化的。五年前很时髦的设计风格,今天看起来可能已经很过时了。这在代码和数学里几乎不会发生,2 加 2 等于 4 不会因为时代变了就变成 5。


AI 为什么没有品味?用数学告诉你答案


所以 Thais 提出了两个核心问题:第一,能力跟着可测量性走(capability follows measurability)。你能测量的地方,模型就能进步;你测量不了的地方,模型就停在原地。第二,主观领域有一个特殊的陷阱,叫 collapse to the mean(均值崩塌),我们后面细讲。


我自己听到这里其实很有感触。我们平时在讨论 AI 能力的时候,习惯于把所有领域平铺在一张能力地图上,然后问某个模型在哪些格子里打了勾。但 Thais 提醒了一件更底层的事情:这张能力地图本身就是不对等的,有些格子天然容易打勾,因为那个领域本身是可验证的;有些格子根本就没办法用打勾的方式来衡量,因为那个领域的"好"不是一个客观答案,而是一个依赖于人、依赖于时间、依赖于情境的判断。把这两类问题混在一起讨论,本来就是在混淆视听。


把模糊的东西变成可以打分的东西——decomposition 是关键


Thais 举了一个特别具体的例子来说明她的方法,我觉得这是整场分享里最实用的一段。她问:什么是好设计?这个问题太大,没法回答。但如果换一个问题:这个页面符不符合这个品牌的调性?突然就具体多了。


她拿了 Reduct 这个品牌举例。如果你把一个品牌拆开来看,它其实是由很多具体的元素组成的:用了什么颜色组合、用了什么字体和字重、间距是怎么定义的、动效的节奏是快是慢、有没有纹理、纹理是什么风格。这些东西单独拿出来,都是可以被明确定义、可以被验证的。我拿一个 AI 生成的页面跟这些标准对比,可以逐项打分:这个颜色用对了吗?这个字体是品牌规范里的吗?这个间距符合设计系统的规则吗?


AI 为什么没有品味?用数学告诉你答案


这就是 Thais 说的 decomposition(分解)的价值。它把一个看起来极其模糊的问题——"这个设计好不好"——转化成了一系列可以逐项验证的子问题。而这个分解本身,就可以成为训练模型的 ground truth(基准答案)。她还特别强调了一个细节:如果你让模型去生成一个新页面,你不是要让它复制原来的设计,而是要让它在遵循这套分解出来的规则的前提下,创造出全新的东西。所以验证标准是那些分解出来的规则,而不是和原版的相似度。


当然,Thais 也承认不是所有东西都能这样分解。她把设计相关的能力画成了一个 spectrum(光谱):一端是接近客观的东西,比如对齐、字重、间距,这些有明确对错;另一端是纯粹的风格感受和创意判断,这些几乎无法量化。她说这是一个 routing problem(路由问题):你需要先理解这个问题落在光谱的哪个位置,然后决定用什么方法来处理它。越靠近可验证的那端,越适合用 RL(强化学习)环境来训练;越靠近纯主观的那端,越需要人类判断来驱动。


我自己觉得这个 routing 的思路是有普适价值的。很多时候我们讨论 AI 在某个领域能不能做好,其实讨论的是一个被我们自己简化过的版本。真实的情况往往是:这个领域里有一部分是可以被分解和验证的,有一部分是需要人类判断的,有一部分是介于两者之间的。把这三层混在一起谈,然后说"AI 在这个领域不行"或者"AI 在这个领域很强",往往都不够准确。正确的问题是:这个领域里哪些部分是可以被机器处理的,哪些部分目前还必须依赖人,边界在哪里?


Collapse to the mean——为什么 AI 做出来的东西总是感觉差不多


这是 Thais 整场分享里我觉得最有洞见的一个概念,也是解释 AI slop 这个现象最底层的原因。


模型的工作原理,本质上是预测下一个最可能出现的内容。在数学和代码领域,最可能出现的答案,恰好也是最好的答案。2 加 2 等于 4,这既是最常见的答案,也是唯一正确的答案,两者重合。但在设计和写作这些领域,最常见的答案和最好的答案之间,存在一个根本性的裂缝。


AI 为什么没有品味?用数学告诉你答案


Thais 说,真正好的创意,往往发生在分布的边缘,不是最可能出现的那个,而是有意识地打破规律、跳出模式的那个。一个让人过目不忘的广告,一个让人第一眼就被击中的设计,往往不是那个最稳妥、最符合惯例的答案,而是某个在常规预期之外的突破。但模型的训练机制天然地把它往中间拉,往最常见的那个答案靠,结果就是输出的东西越来越像均值,越来越没有棱角,越来越像你见过无数次的那种"还不错但不惊艳"的东西。这就是 AI slop 真正的来源,不是模型不够聪明,而是它的优化目标本身就是冲着均值去的。


Taste Labs 应对这个问题的方式,是在数据层主动打破这种均值化的趋势。他们现在跟超过一千位不同领域、不同风格的设计专家合作,在构建训练数据的时候,故意保持这些专家之间的差异性,不把他们的偏好平均掉,而是把这种多样性作为一种有意为之的输入留存下来。这样训练出来的模型,才有可能在适当的时候跳出均值,产生真正有个性的输出。


AI 为什么没有品味?用数学告诉你答案


我自己听到这里是有一种豁然开朗的感觉的。我之前看到很多人抱怨 AI 生成的东西没有灵魂、没有个性,给出的解释通常是"AI 只是在模仿,没有真正的创造力"。但 Thais 给出了一个更精确的解释:这不是能不能创造的问题,而是训练信号本身就在奖励平均,你当然得到的是平均的结果。要解决这个问题,必须在数据和训练环境的设计上动手,而不是等着模型自己进化出创造力。


人类判断力怎么变成高质量数据——这才是最难的工程


Thais 花了相当长的时间讲数据质量这个话题,我觉得这是整场分享里技术含量最高的一部分。


她说,收集主观领域的偏好数据,有一个非常常见的陷阱:你找一堆人来打分,然后把他们的打分平均掉,当作训练信号。这看起来很合理,但问题在于,不同的人在主观问题上天然就会有不同的偏好,这些偏好并不是噪音,而是真实世界的一部分。如果你把它们平均掉,你得到的不是一个更好的答案,你得到的是一个没有意义的混合物,哪个人的偏好都没真正被代表,又把所有人的分歧抹平了。


AI 为什么没有品味?用数学告诉你答案


她提出的解决思路,是给每个用户或者每类用户建立一个 preference vector(偏好向量),用来描述这个人或者这类人的审美倾向、判断标准、风格偏好。这个 preference vector 作为标签跟训练数据绑在一起,模型学到的就不是"什么是好设计的统一标准",而是"对于有这种偏好的人,什么是好设计"。这样训练出来的模型,才有可能真正做到个性化,而不是给所有人同一个均值答案。


她还讲了一个我觉得特别有启发性的数据质量控制方法。他们在做人类 QA(质量审核)的时候,不是让专家简单地说这个设计好或者不好,而是要求专家把他们的评论跟具体的设计元素或者代码组件绑定起来。比如,专家看到一个落地页,不是写一段话说"这个整体感觉不够精致",而是要指出"这里的 hero section 的字间距比品牌规范要求的宽了 2px,导致整体显得松散",同时把这条评论和对应的代码片段关联上。她说,模型在处理视觉和代码的时候,很难自己把一个视觉观感和背后对应的代码段建立联系。但如果训练数据里,专家的评论已经帮模型把这个连接建好了,模型学到的就是更具体、更有操作性的知识,而不是一个模糊的"感觉对不对"的判断。


这里还有一个细节让我觉得很有意思。Thais 提到,在做专家 QA 的时候,偶尔会遇到两个专家对同一个设计的评价完全相反。这时候,关键是要搞清楚他们在什么问题上有分歧。如果两个专家在对齐这种相对客观的问题上意见相左,那可能是数据本身有问题;但如果他们在风格偏好这种纯主观的问题上有分歧,那其实是好事,说明这条数据真实地捕捉到了世界上存在的偏好差异,这种分歧本身就是有价值的信号,不应该被当作噪音过滤掉。


AI 为什么没有品味?用数学告诉你答案


我觉得这个判断特别清醒。很多团队在做数据质量控制的时候,会把"专家意见不一致"直接当成数据质量差的标志,然后把这些有分歧的数据点过滤掉。但这样做,等于把世界上真实存在的偏好多样性也一起过滤掉了,最后得到的数据,反而会更快地往均值崩塌。


质量远比数量重要——这在主观域里是一条硬规则


Thais 在分享的最后说了一句话,我觉得可以当作整场讲座的核心结论:在主观领域,高质量数据远比大量数据重要。


这听起来像是常识,但她讲完前面那些之后,这句话有了非常具体的含义。高质量,不是指数据采集过程规范,不是指标注格式整齐,而是指这些数据是由真正在该领域有高品味(high taste)的专家产生的,是按照正确的问题分解方式来组织的,是把专家的具体判断跟具体的设计元素绑定了的,是保留了偏好多样性而不是把它平均掉的。一条满足这些条件的数据,比一千条廉价众包出来的标注更有训练价值。


她说,在主观领域做数据这件事,本身就非常昂贵,非常困难,需要对这个领域有深刻的理解。但没有捷径,因为模型的输出质量上限,就是训练数据质量的上限。你喂进去的是均值数据,你得到的就是均值模型;你喂进去的是经过严格筛选、保留了真实多样性的专家数据,你得到的才有可能是真正有品味的模型。


我自己的一点思考


听完 Thais 的整场分享,我最大的收获不是某个具体的技术方法,而是一种更清晰的问题框架。我们现在讨论 AI 能力的时候,有一种很常见的惰性思维,就是把所有领域一视同仁,然后问某个模型能力够不够强。但 Thais 提醒了一件更基础的事:不同领域在结构上就是不对等的。有些领域天然是可验证的,有些领域天然是主观的,有些领域介于两者之间。这个结构性的差异,决定了你能用什么方法来训练模型,也决定了模型能在这个领域达到的上限。


我自己特别认同她关于 collapse to the mean 的判断。AI slop 这个现象,本质上是训练信号设计的问题,不是模型智力的问题。你用均值信号训练,就得到均值输出。这个问题不会随着模型参数量的增加自动消失,因为更大的模型只是在更大的数据集上做更精确的均值估计,它不会自动学会"什么时候应该打破规律",除非你在数据和奖励设计上显式地告诉它。


AI 为什么没有品味?用数学告诉你答案


还有一点我觉得对做产品的人也很有参考价值,就是 preference vector 这个概念。今天很多产品在做个性化的时候,思路还是"给用户打一堆标签,然后做推荐"。但 Thais 描述的那种个性化更深一层,它不是在行为层面打标签,而是在审美判断层面建立用户画像,理解这个人对什么风格有共鸣、在什么情境下偏好什么、他的判断标准背后的逻辑是什么。这种理解一旦建立起来,产品能做的事情就完全不一样了,不只是给你推你可能喜欢的内容,而是真正理解你想要什么,然后帮你生成、筛选、优化出符合你品味的东西。


我们正处在一个 AI 工具爆炸式增长的阶段,生成的内容越来越多,但真正让人觉得"这个东西有灵魂"的越来越少。Thais 在做的事情,是在从数据和训练机制的底层去解这道题,而不是在模型表面做优化。这条路更难,但我觉得是更对的方向。到最后,能把 AI 从均值拉出来的,不是更大的模型,而是更好的 taste,更好的数据,以及更清楚地知道这两件事为什么重要的人。


文章来自于"深思圈",作者 "深思圈"。

AI转型,免费服务,就找AITNT
AITNT资源拓展
根据文章内容,系统为您匹配了更有价值的资源信息。内容由AI生成,仅供参考
1
智能体

【开源免费】AutoGPT是一个允许用户创建和运行智能体的(AI Agents)项目。用户创建的智能体能够自动执行各种任务,从而让AI有步骤的去解决实际问题。

项目地址:https://github.com/Significant-Gravitas/AutoGPT


【开源免费】MetaGPT是一个“软件开发公司”的智能体项目,只需要输入一句话的老板需求,MetaGPT即可输出用户故事 / 竞品分析 / 需求 / 数据结构 / APIs / 文件等软件开发的相关内容。MetaGPT内置了各种AI角色,包括产品经理 / 架构师 / 项目经理 / 工程师,MetaGPT提供了一个精心调配的软件公司研发全过程的SOP。

项目地址:https://github.com/geekan/MetaGPT/blob/main/docs/README_CN.md

2
RAG

【开源免费】graphrag是微软推出的RAG项目,与传统的通过 RAG 方法使用向量相似性作为搜索技术不同,GraphRAG是使用知识图谱在推理复杂信息时大幅提高问答性能。

项目地址:https://github.com/microsoft/graphrag

【开源免费】Dify是最早一批实现RAG,Agent,模型管理等一站式AI开发的工具平台,并且项目方一直持续维护。其中在任务编排方面相对领先对手,可以帮助研发实现像字节扣子那样的功能。

项目地址:https://github.com/langgenius/dify


【开源免费】RAGFlow是和Dify类似的开源项目,该项目在大文件解析方面做的更出色,拓展编排方面相对弱一些。

项目地址:https://github.com/infiniflow/ragflow/tree/main


【开源免费】phidata是一个可以实现将数据转化成向量存储,并通过AI实现RAG功能的项目

项目地址:https://github.com/phidatahq/phidata


【开源免费】TaskingAI 是一个提供RAG,Agent,大模型管理等AI项目开发的工具平台,比LangChain更强大的中间件AI平台工具。

项目地址:https://github.com/TaskingAI/TaskingAI