AI技术研报-这里有最前沿的人工智能技术解读

从0到1带你速通Codex，我整理的终极保姆教程来了。

最近Codex的热度，真的感觉直线飙升。

来自主题: AI技术研报

11592 点击 2026-05-29 09:38

LeCun新证明：世界是高斯的

LeCun的LeJEPA到底有没有构建出世界模型？他本人最新发表的论文，解答了这个问题。

来自主题: AI技术研报

9883 点击 2026-05-29 09:37

刚刚，国产预训练具身大模型开源了，让后训练不再是必选项！

2026 年初，国内具身智能赛道掀起了一波开源潮，越来越多团队开始公开自己的视觉-语言-动作（VLA）模型、数据集与训练框架。与此同时，行业竞争也逐渐集中到 benchmark 成绩、任务成功率以及跨任务泛化能力上，尤其是在标准化或已训练任务中的表现。

来自主题: AI技术研报

8784 点击 2026-05-29 09:19

大模型也需要睡觉！让AI打个盹，醒来更聪明

7×24，AI也吃不消。

来自主题: AI技术研报

7950 点击 2026-05-29 09:19

多变量神经缩放定律迈向大一统：Mila联手DeepMind提出UNSL

过去的大模型 scaling law 通常回答的是：当模型参数量、数据量和训练计算量增加后，loss 会如何下降。

来自主题: AI技术研报

7228 点击 2026-05-29 09:19

刚刚，DeepSeek陈德里与两个AI，合写了一篇论文

「借助 CodeAgent，我终于可以重新捡起很多过去因为精力不足而搁置的事情了，写博客就是其中之一。这篇博客大概 1% 是我写的，99% 是 Agent 写的 😂」。

来自主题: AI技术研报

7576 点击 2026-05-29 09:19

重塑人机对话理解范式，Google新数据集首次大规模捕捉用户「未言明的想法」

当对话型 AI 服务于数十亿用户时，我们能否看见用户没说出口的那一层？JHU、MIT 和 Google Research 给出了新的解法。

来自主题: AI技术研报

9205 点击 2026-05-29 09:18

GPT-5.5翻倍，Gemini涨3倍：这波涨价游戏还能玩多久？

Epoch AI刚刚发布的《梯度更新》报告，做了一件简单粗暴的事：把全球所有Blackwell芯片能处理的Token数量算出来，再和实际需求一比。结论只有一个字——不够。

来自主题: AI技术研报

8963 点击 2026-05-28 20:59

首次！DeepSeek-V4-Pro全参数后训练，被第三方在国产卡上跑通

近期，深圳河套学院（SLAI）AI训练平台项目团队，联合哈尔滨工业大学（深圳）、深圳大数据研究院、华为GTS（全球技术服务）团队与深智城AI算力平台，仅用1个月，共同基于昇腾910C国产算力集群实现DeepSeek-V4-Pro全参数续训练/SFT稳定运行，完成长稳训练1500+步，训练MFU超30%，关键训练算子效率提升14%。

来自主题: AI技术研报

10974 点击 2026-05-28 14:56

7B打败o3、GPT-5！医学AI智能体让模型学会“看哪里、怎么看”

医学AI会写解释，但不代表它真的“看到”了关键证据。

来自主题: AI技术研报

10621 点击 2026-05-28 14:51

全球首次单机降服万亿巨模DeepSeek-V4！RL后训练框架Orbit开源！

从数学、代码、复杂推理，到多轮工具调用，大模型的很多能力的提升都离不开 RL 后训练。但当模型规模进入 MoE 万亿参数级别之后，RL 不再只是一个算法问题，同时更加是一个系统问题。

来自主题: AI技术研报

7763 点击 2026-05-28 14:51

Speech LLM 的下一个突破口：你的语音大模型可以是个「带韵律的文本模型」

相信大家都有过这样的体验：同一个系列的模型，使用文本交互的时候，模型就像开启了 “最强大脑”，数学代码等各种复杂推理任务样样精通，可是一旦将其改造成语音对话模型之后，性能就猛烈下降，严重 “降智”，经常会犯很多基本的逻辑错误。

来自主题: AI技术研报

6380 点击 2026-05-28 14:51

高分辨率视频生成不再慢半拍：让大模型保留“原味”的同时提速十余倍

当下视频生成模型正在快速逼近真实世界的画面质感，但一个现实瓶颈也越来越突出—— 那就是分辨率越高，生成所需要的时间就越长。

来自主题: AI技术研报

8389 点击 2026-05-28 14:50

ICML2026 | AutoMoT : B2D & nuScense双SOTA ，重新思考VLM和端到端驾驶的结合

大模型进入自动驾驶后，最直接的价值在于场景理解。它可以识别前车是否准备并线、行人是否可能横穿、施工区域是否会影响车道，也可以分析复杂路口中的让行关系。

来自主题: AI技术研报

10621 点击 2026-05-28 14:50

好抓马！AI删光2.8万行代码，干崩后台，还编造了一份故障修复报告

Gemini 3.5的闯祸实录。

来自主题: AI技术研报

8498 点击 2026-05-28 11:25

开源个 Skill｜彻底解决小红、小绿书配图难题

前段时间开源了 guizang-ppt-skill，之后我自己用它做内容的时候发现一件事。

来自主题: AI技术研报

7107 点击 2026-05-28 11:25

T-PAMI｜中国科大、合工大等提出CAPER++：让关节物体位姿感知真正迈向「又快又稳」

在具身智能快速发展的今天，机器人已经不再满足于「看见」刚体物体，而是开始真正走向复杂环境中的交互与操作。从机械臂开柜门，到服务机器人整理抽屉，再到工业场景中的工具操作，大量真实世界目标都属于关节物体（Articulated Objects）。

来自主题: AI技术研报

8961 点击 2026-05-28 10:18

5秒完成3D场景编辑，北大&港中文&上海AI Lab搞出VGGT-Edit，120倍加速太炸了

3D世界“会看”了，但还不会“改”。

来自主题: AI技术研报

8822 点击 2026-05-28 09:52

这家创业公司发现了大模型的一个根本性缺陷

你有没有想过，我们每天用的 AI 大模型，可能在某些词汇上天生就有缺陷？不是因为训练数据不够，不是因为算力不足，而是因为语言本身的规律——那些用得少的词，模型就是学不好。更让人意外的是，这个问题早在 2025 年就被一家中国创业公司系统性地发现并解决了。

来自主题: AI技术研报

7452 点击 2026-05-28 09:52

Token账单爆炸？用「TELOS」强制命中缓存，一键剩下90%的账单！

就在几天前（5月22日），DeepSeek官方扔出了一枚重磅炸弹：DeepSeek-V4-Pro将在5月底结束优惠后，永久降价至原价的四分之一。各大媒体瞬间被诸如“白菜价”、“夯爆了”的标题刷屏。看看这组惊人的新定价：每百万Token输出6元，输入（缓存未命中）3元，而输入（缓存命中）仅仅只要0.025元！

来自主题: AI技术研报

8025 点击 2026-05-28 09:51