Jev刷屏之后,竟然有人12个月前就提出了概率并行生成?

AITNT-国内领先的一站式人工智能新闻资讯网站
# 热门搜索 #
Jev刷屏之后,竟然有人12个月前就提出了概率并行生成?
8180点击    2026-09-26 15:00

2026 年 9 月,Jev 刷屏了。围绕这款直接输出判断和概率的 AI 模型,讨论已经持续了好几天。


从 X 上的演示到开发者的应用尝试,一个问题浮出水面:当 AI 用来做决策,还需要先生成一长串文字吗?


但如果把时间拨回整整一年前呢?


2025 年 9 月,已经有研究提出:让模型一次并行生成多种可能的未来,并直接给出它们的概率。 


而且,这篇论文从一开始,就把「服务决策」写进了研究动机。


这项研究来自香港中文大学徐强教授团队,论文题为《From Samples to Scenarios: A New Paradigm for Probabilistic Forecasting》(从采样到场景:概率预测的新范式),于 2025 年 9 月 24 日公开,现已被 ICLR 2026 接收。TimePrism 是为这一范式设计的验证模型。


Jev刷屏之后,竟然有人12个月前就提出了概率并行生成?


  • 论文链接:https://arxiv.org/abs/2509.19975
  • 代码链接:https://github.com/Fifthky/TimePrism


「显式概率」「并行输出」「面向决策」,如今 Jev 受到关注的设计思路,在这项研究中早已形成了一套用于概率预测的方法。


两个不同的领域,为什么会走向相似的方向?


Jev 为什么火:让模型直接给出决策所需的信息


Jev 把日常交流中的判断变成了模型的核心任务:这条信息该不该保留?下一步应该选择哪个动作?任务是否已经完成?


开发者提供文本或程序状态,定义问题和选项,再由模型返回概率、评分等结构化结果,供程序使用。


这些任务通常不需要一篇长回答。Jev 采用面向判断的输出方式,并支持针对同一份输入并行处理多个问题。


这让它与大家熟悉的逐 token 文本生成形成了鲜明区别,也让 Agent 中大量频繁发生的小决策成为自然的应用场景。


在 X 上,创始人的游戏和网页导航演示把这种变化展示得很直观;随后出现的开发者实验,继续延伸了讨论。传播的焦点,是 AI 如何更直接地进入软件的决策过程。


TimePrism 回答的是概率预测中的同类问题:系统需要提前行动时,模型应该交付什么?


它给出的答案是一组可能结果,以及每个结果的概率。这样,后续系统就能根据不同结果的成本与收益,比较行动方案。


从采样到场景:把「会发生什么」和「多大可能」一起学出来


假设一个系统要安排明天的备用电力。单一的发电量预测还不够:正常发电、发电量大幅下降,都可能对应不同的准备方案。


系统需要知道有哪些可能的未来,以及每种未来出现的可能性。


常见的概率预测方法通过采样表达这些可能性:反复生成未来轨迹,再从样本集合中估计分布。样本越多,统计信息通常越充分,相应的生成和处理成本也会增加。


TimePrism 提出的「概率场景」范式,把学习目标直接写成 {场景,概率}。


模型既学习有代表性的未来场景,也显式学习这些场景上的概率分布;推理时,一次前向计算就能并行得到整组结果。


Jev刷屏之后,竟然有人12个月前就提出了概率并行生成?


从采样到场景:一次输出一组可能的未来及其概率。来源:论文图 1。


这意味着,概率不再需要仅靠大量重复样本的频率来体现。


每个场景都带有自己的权重,决策系统可以直接计算不同方案在这些场景下的预期成本,或为代价较大的情况预留资源。


Jev刷屏之后,竟然有人12个月前就提出了概率并行生成?


原文曲线对比。上排为 TimePrism 的概率场景,蓝色粗线表示较高概率,红色细线表示较低概率;下排为基线 TACTiS-2  的采样结果。来源:论文图 4。


图中,相似的历史之后,既可能出现常见的高峰,也可能出现少见的低峰。上排将这些不同走向及其概率一起呈现出来。


「从采样到场景」的变化,正是让可能的未来成为可以直接比较和使用的对象。


为了验证这个想法,团队只用了三个线性层


TimePrism 的核心可学习结构只有三个并行线性层:两个分支生成未来场景,一个分支学习对应概率。训练时,场景分支学习覆盖不同的真实未来,概率分支学习这些场景各自的权重。


团队有意采用这种简洁设计,检验一个关键假设:如果学习目标与输出形式设计得当,简单结构也能做好复杂的概率预测。 架构的作用,是把新范式的有效性清楚地展示出来。


Jev刷屏之后,竟然有人12个月前就提出了概率并行生成?


TimePrism 架构:场景与概率分别建模,三个分支并行计算。来源:论文图 3。


论文在五个基准数据集上比较了两项主要指标,TimePrism 在十项比较中取得九项最佳结果,以很小的计算开销胜过多种复杂的概率预测模型,其中包括扩散模型、Flow 模型和基于 Transformer 的模型。


这个结果为论文的核心想法提供了实验支持:改变学习范式,可以让极简结构释放出更强的能力。


这样的研究方式,也延续了通讯作者徐强团队一贯的探索。2023 年,团队发表《Are Transformers Effective for Time Series Forecasting?》,用简单线性模型挑战当时的 Transformer 预测方法,引发了激烈讨论。


截至 2026 年 9 月,其 Google Scholar 引用已超过六千次。该论文是近年来时序预测领域最重要的论文之一,深刻地影响了整个预测领域的发展。


这篇 DLinear 论文的影响超出了具体的预测任务:并不是所有领域,直接使用 Transformer 就会更好,促使研究者重新审视任务假设与模型结构的关系。


有趣的是,这一次,团队为了验证概率场景范式,特意选择简单的线性架构,并将场景与概率分别建模,也恰好致敬了自己的 DLinear。


Jev 与 TimePrism 的相遇,指向了什么?


把两项工作放在一起看,最值得关注的共同点,是根据决策需求重新设计模型的输出。选项及其概率、未来场景及其权重,都能直接进入后续程序的判断与计算。概率因此成为模型与决策系统之间的一种接口。


两者也都体现了并行处理的价值。Jev 可以围绕同一份输入并行回答多个判断问题,减少逐字生成文本的开销;TimePrism 则一次输出整组未来场景与概率,省去推理阶段的反复采样。


各自的计算方式,都围绕最终需要的结果重新组织。


Jev刷屏之后,竟然有人12个月前就提出了概率并行生成?


两者的差异同样有意思。Jev 面向自然语言和程序状态,通常由开发者定义问题或候选选项,再由模型判断。


TimePrism 面向未来的不确定性,连「有哪些候选未来」也交给模型学习。前者侧重对给定问题作判断,后者侧重生成带有概率的未来图景。


这让它们展示出两种不同层面的通用性:Jev 用统一的判断接口承接多种语义任务;TimePrism 则提出一种可以继续拓展的学习范式,让模型同时学习候选结果及其概率。


显式概率、并行输出、面向决策,是两条路径相通的设计思路。


概率场景的潜力也值得放到更广的任务中探索。机器人需要比较不同运动轨迹,规划系统需要考虑多种后续状态,资源调度需要权衡不同需求情景。这些任务都可能受益于「多个候选结果及其概率」的输出形式。


结语


未来,概率场景范式可以结合更强的骨干网络、更加复杂的场景表示,以及规划与优化方法。TimePrism 提供了一个简洁的起点:先明确决策需要怎样的信息,再设计模型如何学习和交付这些信息。


Jev 的走红,让这条路线获得了新的关注。回看 2025 年 9 月的论文,港中文徐强团队提出的「从采样到场景」,已经在概率预测中展开了同一个关键命题:让 AI 一次看见多种可能,并把它们交给下一步决策。


文章来自于微信公众号 “机器之心”,作者 “机器之心”

AI转型,免费服务,就找AITNT
AITNT资源拓展
根据文章内容,系统为您匹配了更有价值的资源信息。内容由AI生成,仅供参考
1
智能体

【开源免费】AutoGPT是一个允许用户创建和运行智能体的(AI Agents)项目。用户创建的智能体能够自动执行各种任务,从而让AI有步骤的去解决实际问题。

项目地址:https://github.com/Significant-Gravitas/AutoGPT


【开源免费】MetaGPT是一个“软件开发公司”的智能体项目,只需要输入一句话的老板需求,MetaGPT即可输出用户故事 / 竞品分析 / 需求 / 数据结构 / APIs / 文件等软件开发的相关内容。MetaGPT内置了各种AI角色,包括产品经理 / 架构师 / 项目经理 / 工程师,MetaGPT提供了一个精心调配的软件公司研发全过程的SOP。

项目地址:https://github.com/geekan/MetaGPT/blob/main/docs/README_CN.md