AI资讯新闻榜单内容搜索-端到端

AITNT-国内领先的一站式人工智能新闻资讯网站
# 热门搜索 #
搜索: 端到端
生成模型也能端到端训练了?核心竟是一个for循环

生成模型也能端到端训练了?核心竟是一个for循环

生成模型也能端到端训练了?核心竟是一个for循环

最近,一篇来自 UIUC 与哈佛大学的论文,试图把这块最后的拼图补上。作者给这个新范式起了个名字,叫 Explorative Modeling(探索式建模),模型简称 XM。它的想法简单到近乎朴素,却指向一个大胆的结论:生成模型除了参数和数据,其实还有第三根可以放大的轴。

来自主题: AI技术研报
7146 点击    2026-08-02 11:16
世界模型不再「盲搜」9000次:浙大、清华等团队提出INTACT,直接从意图生成动作

世界模型不再「盲搜」9000次:浙大、清华等团队提出INTACT,直接从意图生成动作

世界模型不再「盲搜」9000次:浙大、清华等团队提出INTACT,直接从意图生成动作

浙江大学、清华大学智能产业研究院、影溯 InSpatio、RoboParty Lab 等团队提出的 INTACT(INtent-To-ACTion),一种基于端到端 JEPA 的无搜索世界模型控制方法,试图改变这一范式:直接利用离线轨迹中已有的状态、动作与未来结果,将运动意图转化为动作模型可以读取的语义接口,使模型无需搜索候选动作序列,就能直接生成动作计划

来自主题: AI技术研报
8370 点击    2026-08-01 10:47
Lychee-FD:哈工大张民教授团队在全双工语音大模型领域取得重要突破,斩获ACL 2026杰出论文奖

Lychee-FD:哈工大张民教授团队在全双工语音大模型领域取得重要突破,斩获ACL 2026杰出论文奖

Lychee-FD:哈工大张民教授团队在全双工语音大模型领域取得重要突破,斩获ACL 2026杰出论文奖

全双工语音对话是人类最自然的交流方式,是语音对话研究的梦想。相比文本输入,语音天然更接近人的交流方式,但现有语音对话常常停留在 “一问一答、听完再说” 的轮次式交互范式。

来自主题: AI技术研报
9897 点击    2026-07-16 14:55
AI生图免训练提速1000%,办法:最简洁的“三阶段流水线”

AI生图免训练提速1000%,办法:最简洁的“三阶段流水线”

AI生图免训练提速1000%,办法:最简洁的“三阶段流水线”

MrFlow(Multi-Resolution Flow Matching)就用这样的三阶段,在Qwen-Image等模型上把端到端生成时间从49.32s压到4.77s,实际加速10.35x。文章发布当日即登上Hugging Face Daily Papers;发布三天内,GitHub已收获200+stars;目前也已登上Hugging Face Trending Papers。

来自主题: AI技术研报
8636 点击    2026-07-08 15:02
Claude、GLM、GPT谁才是真正的AI软件工程师?首个持续更新Visual Spec-to-App Benchmark发布

Claude、GLM、GPT谁才是真正的AI软件工程师?首个持续更新Visual Spec-to-App Benchmark发布

Claude、GLM、GPT谁才是真正的AI软件工程师?首个持续更新Visual Spec-to-App Benchmark发布

为了解决这一问题,来自 University of Arizona、Zoom 与 Stony Brook University 的研究团队推出了 VISTA(VIsual Spec-To-App Benchmark), 首个面向 Visual Spec-to-Web-App Coding Agents 的端到端 Benchmark。

来自主题: AI技术研报
8255 点击    2026-07-06 15:49
机器人看视频学操作!伯克利首次打通互联网视频到灵巧手真机部署链路

机器人看视频学操作!伯克利首次打通互联网视频到灵巧手真机部署链路

机器人看视频学操作!伯克利首次打通互联网视频到灵巧手真机部署链路

UC Berkeley团队提出的端到端流程旨在解决该问题,研究团队跑通了首条能够从网络视频生成真实灵巧手实机执行轨迹的完整链路:先从真实场景中的单目RGB视频中重建4D手-物交互过程,再将这些交互轨迹重定向到拥有22个自由度的Sharpa Wave灵巧手上。

来自主题: AI技术研报
7870 点击    2026-07-06 15:47
刚刚,百度开源模型Unlimited OCR拿下全球第一!作者疑似DeepSeek出走大神

刚刚,百度开源模型Unlimited OCR拿下全球第一!作者疑似DeepSeek出走大神

刚刚,百度开源模型Unlimited OCR拿下全球第一!作者疑似DeepSeek出走大神

最新开源的Unlimited OCR,总参数3B,实际激活仅500M——放在大模型时代几乎是个零头。但就是这个小到离谱的模型,在OmniDocBench v1.5上拿下93.23%的综合分,v1.6更是达到93.92%,直接刷新了端到端SOTA。

来自主题: AI资讯
16331 点击    2026-06-22 20:06
如何用 6 倍速 Kimi K2.7 Code,做「小红书端到端排版 Skill」?

如何用 6 倍速 Kimi K2.7 Code,做「小红书端到端排版 Skill」?

如何用 6 倍速 Kimi K2.7 Code,做「小红书端到端排版 Skill」?

昨天 Kimi K2.7 Code 高速版 上线了,我上手试了下,最大的感受就一个字:快。

来自主题: AI技术研报
10011 点击    2026-06-17 10:52
腾讯Robotics X开源HyVLA-0.5:基于亚毫米级指套UMI与真机强化,摆脱繁重遥操

腾讯Robotics X开源HyVLA-0.5:基于亚毫米级指套UMI与真机强化,摆脱繁重遥操

腾讯Robotics X开源HyVLA-0.5:基于亚毫米级指套UMI与真机强化,摆脱繁重遥操

6 月 15 日,腾讯 Robotics X、福田实验室与混元团队联合发布面向真实世界机器人操作任务的端到端具身智能模型 Hy-Embodied-0.5-VLA(简称 HyVLA-0.5)。

来自主题: AI技术研报
11147 点击    2026-06-16 10:21
前联影集团AI创新业务负责人创业做AI硬件原型开发平台STACK ANYWAY,完成种子轮融资

前联影集团AI创新业务负责人创业做AI硬件原型开发平台STACK ANYWAY,完成种子轮融资

前联影集团AI创新业务负责人创业做AI硬件原型开发平台STACK ANYWAY,完成种子轮融资

观点跃迁研发了全球首个Text to Device AI电子设备生成平台STACK ANYWAY,旨在打通从“任意想法”到“现实硬件”的端到端链路。据观点跃迁估算,在海量的硬件SKU中,至少70%-80%属于硬件原型阶段,而这些原型实际上撬动了规模更大的量产硬件市场。整个硬件原型开发相关市场规模粗略估算已达上百亿美元。

来自主题: AI资讯
8619 点击    2026-06-14 10:50