AI资讯新闻榜单内容搜索-LLM

AITNT-国内领先的一站式人工智能新闻资讯网站
# 热门搜索 #
搜索: LLM
Loss收敛不代表学会:腾讯混元ACL 2026拆解SFT训练中15.3%的“假学会”样本

Loss收敛不代表学会:腾讯混元ACL 2026拆解SFT训练中15.3%的“假学会”样本

Loss收敛不代表学会:腾讯混元ACL 2026拆解SFT训练中15.3%的“假学会”样本

SFT是LLM从“通才”变成“专才”的关键步骤。业界默认做法是:准备标注数据(QA对、指令-回复对等)在基座模型上跑SFT训练。看loss曲线收敛了→认为训练完成。但问题在于:loss是全局平均,掩盖了样本间的差异。loss收敛只代表“大部分样本学会了”——那些始终学不会的样本被淹没了。

来自主题: AI技术研报
8035 点击    2026-07-26 11:25
多模态大模型训练的显存与吞吐困局,被小红书开源的BigMac打破了

多模态大模型训练的显存与吞吐困局,被小红书开源的BigMac打破了

多模态大模型训练的显存与吞吐困局,被小红书开源的BigMac打破了

BigMac 是原生多模场景下的流水并行训练新范式。它针对多模态大模型训练中计算效率与显存占用难以兼顾的问题,提出了依赖安全的嵌套流水线:以成熟的 LLM 流水线为主干,在不打乱 LLM 执行顺序的前提下,有序嵌入编码器和生成器计算,从而在不增加 LLM 流水线空泡、保持激活显存有界的同时,高效实现多模态流水训练。

来自主题: AI技术研报
8096 点击    2026-07-24 15:55
花几百万买的H100在「摸鱼」?英伟达:别怪显卡,是你的模型「长得丑」

花几百万买的H100在「摸鱼」?英伟达:别怪显卡,是你的模型「长得丑」

花几百万买的H100在「摸鱼」?英伟达:别怪显卡,是你的模型「长得丑」

就在最近,英伟达亲自下场,发布了一篇名为《AI Model Co-Design: Hardware-Friendly LLM Design》的技术博客。整篇文章洋洋洒洒,其实就想点醒行业一件事:别光顾着堆算力了,来看看你们是怎么把顶级显卡逼成“磨洋工”的吧。

来自主题: AI技术研报
9175 点击    2026-07-22 15:21
WAIC五位首席科学家交锋:多模态是LLM的“外挂”,还是下一代智能的“灵魂”?

WAIC五位首席科学家交锋:多模态是LLM的“外挂”,还是下一代智能的“灵魂”?

WAIC五位首席科学家交锋:多模态是LLM的“外挂”,还是下一代智能的“灵魂”?

作为WAIC 2026最受关注的论坛,由商汤科技承办的“基座大模型架构创新与生态合作论坛”吸引了无数AI研究者、产业专家和投资机构的目光。因它直面了当前大模型行业最核心的焦虑:当Scaling Law在逼近物理极限,多模态究竟是破局的“解药”,还是新瓶装旧酒的延伸?

来自主题: AI资讯
9080 点击    2026-07-19 10:11
给多智能体LLM装上「图记忆工作流路由器」,搞定调用、协作规划

给多智能体LLM装上「图记忆工作流路由器」,搞定调用、协作规划

给多智能体LLM装上「图记忆工作流路由器」,搞定调用、协作规划

GraphPlanner通过引入图记忆网络,将多智能体LLM的路由过程升级为动态工作流生成。不仅选择调用哪个模型,还决定每个模型应承担的角色,实现任务分解与协作规划。

来自主题: AI技术研报
7590 点击    2026-07-12 10:46
跟AI说“出片穿搭”,它真能听懂!淘宝ShopX让大模型直接“卖货”了

跟AI说“出片穿搭”,它真能听懂!淘宝ShopX让大模型直接“卖货”了

跟AI说“出片穿搭”,它真能听懂!淘宝ShopX让大模型直接“卖货”了

团队提出了ShopX:一个面向agentic shopping的电商大模型。它不仅仅是在搜索框外面套一个会“说话”和“调用工具”的LLM,而是赋予模型直接进入商品空间的能力,让大模型成为商品履约的核心,学会在商品空间中规划、检索、排序、组合和生成结果,进而减少接口损耗。

来自主题: AI技术研报
9567 点击    2026-07-11 11:14
ICML 2026|如何对Multi-Agent系统进行过程评估?重新认识多智能体系统中的Orchestrator

ICML 2026|如何对Multi-Agent系统进行过程评估?重新认识多智能体系统中的Orchestrator

ICML 2026|如何对Multi-Agent系统进行过程评估?重新认识多智能体系统中的Orchestrator

来自南京大学 NLP 实验室的 ICML 2026 论文 Recognize Your Orchestrator: An Entropy Dynamics Perspective for LLM Multi-Agent Systems 指出:在当前主流的 Orchestrator-Executor 多智能体架构中,系统失败往往并不首先来自某个执行器不会干活,

来自主题: AI技术研报
8580 点击    2026-07-06 15:48
Router的作用被低估了?vLLM这个神器,让单次调用背后藏了一支模型协作小队

Router的作用被低估了?vLLM这个神器,让单次调用背后藏了一支模型协作小队

Router的作用被低估了?vLLM这个神器,让单次调用背后藏了一支模型协作小队

vLLM 社区推出的 Semantic Router 除了专注上面三个方向,正在更进一步:我们认为:router 不只是选择模型,还可以提升模型能力。用户不用改权重,也不用让每个 Agent 团队都自己搭一套 Graph,而是在一次普通 Model API 调用的内部,组织出一支有边界、有预算、有验证、有回退的 “小队”。

来自主题: AI技术研报
8904 点击    2026-07-05 09:43
从LLM到JEPA,中国团队正在把“世界模型”搬进细胞内部

从LLM到JEPA,中国团队正在把“世界模型”搬进细胞内部

从LLM到JEPA,中国团队正在把“世界模型”搬进细胞内部

最近,AI虚拟细胞(AIVC)赛道,迎来关键突破!作为全球最早布局该领域的企业之一,百曜科技正式发布全球首个基于LLM-JEPA架构的AI虚拟细胞世界模型——AURA CellOS。

来自主题: AI资讯
9374 点击    2026-07-04 11:18