AI产品测评-这里有最详细的人工智能工具测评解析

AITNT-国内领先的一站式人工智能新闻资讯网站
# 热门搜索 #
全网最硬核 OpenClaw 2.0 实测:从 ToC 到 ToB 的试探,Agent 网关能重塑工作流边界吗?

全网最硬核 OpenClaw 2.0 实测:从 ToC 到 ToB 的试探,Agent 网关能重塑工作流边界吗?

全网最硬核 OpenClaw 2.0 实测:从 ToC 到 ToB 的试探,Agent 网关能重塑工作流边界吗?

OpenClaw 2.0(v2026.8.1)对比前代v2026.7.1-2的实测显示,新版将LLM请求次数减少38%、工具调用减少35%且未触发上下文压缩,把开源Agent从个人工具推向可长期托管、可协作复盘的工作系统,但命令行安装和工程门槛依然较高,更适合团队受控环境测试。

来自主题: AI产品测评
9078 点击    2026-09-05 11:08
全网首发,实测首个AGI级别模型GPT-6:22 分钟,做出一座能逛的白宫。

全网首发,实测首个AGI级别模型GPT-6:22 分钟,做出一座能逛的白宫。

全网首发,实测首个AGI级别模型GPT-6:22 分钟,做出一座能逛的白宫。

实测首个AGI级别模型GPT-6,用一张白宫照片在22分钟内生成可自由漫游和调光的三维场景,并完成秦始皇骑北极熊的SVG动画、一句话制作马里奥风格赛车游戏及模仿孙宇晨风格的短文写作,展现其根据简短需求主动补全细节的能力。

来自主题: AI产品测评
7307 点击    2026-09-05 10:52
「豆包工作」升级实测:多Agents并行,操作Mac电脑

「豆包工作」升级实测:多Agents并行,操作Mac电脑

「豆包工作」升级实测:多Agents并行,操作Mac电脑

豆包工作新增多Agents并行与Mac电脑GUI操作两大功能,实测可完成Mac mini购机配置调研、自动撰写邮件草稿、调整长辈电脑系统设置及批量定时发送微博等任务。

来自主题: AI产品测评
7965 点击    2026-09-04 15:50
全网实测开玩Fable 5.1,听说写作说话和真人没区别?

全网实测开玩Fable 5.1,听说写作说话和真人没区别?

全网实测开玩Fable 5.1,听说写作说话和真人没区别?

Anthropic前脚刚发布了Fable 5.1(具体可见Claude最强Fable 5.1发布!8项屠榜,最高降价45%,反蒸馏机制上线),后脚第三方权威跑分和个人第一手实测已经出炉了!

来自主题: AI产品测评
7779 点击    2026-09-03 10:08
实测比DeepSeek便宜的Qwen 3.8 Flash,卷飞了

实测比DeepSeek便宜的Qwen 3.8 Flash,卷飞了

实测比DeepSeek便宜的Qwen 3.8 Flash,卷飞了

阿里千问新模型,又卷出了新水平。

来自主题: AI产品测评
7270 点击    2026-08-31 10:21
实测Cocode:给普通人准备的DeepSeek桌面端

实测Cocode:给普通人准备的DeepSeek桌面端

实测Cocode:给普通人准备的DeepSeek桌面端

8月14日,一个叫Cocode的项目悄悄出现在GitHub上,简介写得很直白,基于DeepSeek Harness构建的开箱即用发行版。不到两周,它拿到150多个star,并在8月25日发布了v1.0.2。

来自主题: AI产品测评
9045 点击    2026-08-28 11:03
拍AI短剧的成本,被这款免费的视频模型打到地板|实测Pavo

拍AI短剧的成本,被这款免费的视频模型打到地板|实测Pavo

拍AI短剧的成本,被这款免费的视频模型打到地板|实测Pavo

AI短剧的女主接一条广告,60秒报价25万元。另一边,一条AI天宫短片在海外刷屏,零推广、小成本,数以万计的海外观众追着去搜中国神话。做出这条短片的栖光,是成都一名90后眼镜店老板,没学过影视,也没有团队,AI创作只是他坚持了两年的业余爱好。这条刷屏的天宫短片,正是用Pavo做出来的。

来自主题: AI产品测评
9252 点击    2026-08-27 09:53
实测豆包工作:连上飞书后,Agent 终于像个同事了

实测豆包工作:连上飞书后,Agent 终于像个同事了

实测豆包工作:连上飞书后,Agent 终于像个同事了

刚刚,豆包正式发布了一款新产品——豆包工作。全新 Logo、独立的桌面客户端,它的定位很明确:一个面向生产力场景的全新 Agent 产品与品牌。

来自主题: AI产品测评
9328 点击    2026-08-25 14:36
首发实测,27B的源神Qwen3.8,能成为Claude Opus 4.6的轻量平替吗?

首发实测,27B的源神Qwen3.8,能成为Claude Opus 4.6的轻量平替吗?

首发实测,27B的源神Qwen3.8,能成为Claude Opus 4.6的轻量平替吗?

Claude Opus 4.6的轻量平替,只需要 27B 参数,你信吗?最近发布的Qwen3.8-27B,就顶着这样的评价火遍了开源社区。上线两天,下载量突破100万次,登顶Hugging Face全球大模型趋势榜。

来自主题: AI产品测评
10895 点击    2026-08-23 14:12
1分钱9张图!DeepSeek视觉模型连夜实测

1分钱9张图!DeepSeek视觉模型连夜实测

1分钱9张图!DeepSeek视觉模型连夜实测

等了四个月,DeepSeek的多模态模型:deepseek-v4-flash-vision-exp,终于发布。我也是第一时间赶到现场,连夜开始实测。相比V4 Flash最大的不同,就是支持原生支持图片输入了,但图片生成当然还是没有的。

来自主题: AI产品测评
9130 点击    2026-08-22 14:27
开启Benchmark的Harness时代:15家学术机构联合发布HarnessEval

开启Benchmark的Harness时代:15家学术机构联合发布HarnessEval

开启Benchmark的Harness时代:15家学术机构联合发布HarnessEval

8 月 13 日,DeepSeek 开源 Agent Harness dsh,将 “Harness” 这个原本更偏工程语境的概念,推到了整个 AI 行业讨论的中心。

来自主题: AI产品测评
7192 点击    2026-08-19 14:37
AI做游戏有多野?实测最近爆火的 Spellcaster

AI做游戏有多野?实测最近爆火的 Spellcaster

AI做游戏有多野?实测最近爆火的 Spellcaster

不会写代码,能不能做出一款自己的游戏?

来自主题: AI产品测评
10479 点击    2026-08-19 11:45
独家 | 字节内测“漫剧创作工具”:搭载豆包大模型,支持20万字剧本上传

独家 | 字节内测“漫剧创作工具”:搭载豆包大模型,支持20万字剧本上传

独家 | 字节内测“漫剧创作工具”:搭载豆包大模型,支持20万字剧本上传

《读佳》获知,字节正在内测一款漫剧创作产品,名字就叫“漫剧创作工具”,Slogan“让创作更纯粹”,搭载豆包多个大模型。

来自主题: AI产品测评
7606 点击    2026-08-18 11:53
Seedance 2.5就够了?Flova全能六边形Agent,想补上创作者真正缺的“片场”|测评

Seedance 2.5就够了?Flova全能六边形Agent,想补上创作者真正缺的“片场”|测评

Seedance 2.5就够了?Flova全能六边形Agent,想补上创作者真正缺的“片场”|测评

上回说到,Seedance 2.5上线后,我们第一时间做了模型更新的能力测试。结果很惊艳,AI的指令遵循、运动效果、表演张力、人物一致性和全模态参考都有了大进步。

来自主题: AI产品测评
7402 点击    2026-08-17 15:39
第三方机构实测:Agent 场景下,Kimi K3 反超 GPT-5.6 Sol

第三方机构实测:Agent 场景下,Kimi K3 反超 GPT-5.6 Sol

第三方机构实测:Agent 场景下,Kimi K3 反超 GPT-5.6 Sol

Kimi K3 发布十天后,AI 原生云服务商 Together AI 公布了一份独立评测报告。

来自主题: AI产品测评
10608 点击    2026-08-10 15:06
实测阿里万有无界:让小万建群,它说人没齐死活不建

实测阿里万有无界:让小万建群,它说人没齐死活不建

实测阿里万有无界:让小万建群,它说人没齐死活不建

每天1000个注册名额,凌晨6点刷新,用完了就得进Waitlist排队,等短信通知。

来自主题: AI产品测评
9924 点击    2026-08-06 10:14
实测袋马:一句话生成的小程序,敢点「发布」吗

实测袋马:一句话生成的小程序,敢点「发布」吗

实测袋马:一句话生成的小程序,敢点「发布」吗

在AI应用生成这个赛道上,选手已经排到了两位数。腾讯有吐司,百度有秒哒,字节有Trae,阿里自家就有Qoder,现在又冒出来一个「袋马」。

来自主题: AI产品测评
7154 点击    2026-08-06 09:38
Doubao-Seed-Evolving 实测:把 edulab 交互技能做成 AI 教学课件

Doubao-Seed-Evolving 实测:把 edulab 交互技能做成 AI 教学课件

Doubao-Seed-Evolving 实测:把 edulab 交互技能做成 AI 教学课件

上一篇我用 Doubao-Seed-Evolving,把复杂 PRD 拆成可执行工程,做成了 AI 教学视频平台。那次重点是“知识驱动出片”:学科知识点 → 教学分镜 → 配音 → 动画 → 1080p 成片。

来自主题: AI产品测评
7259 点击    2026-08-06 09:37
1小时花一亿token极限实测DeepSeek-V4-Flash,得出7个结论

1小时花一亿token极限实测DeepSeek-V4-Flash,得出7个结论

1小时花一亿token极限实测DeepSeek-V4-Flash,得出7个结论

DeepSeek-V4-Flash风评冲爆了,原生支持接入Codex,而且还强化了Agent能力。我第一时间把它接进了Codex,用cc swich非常方便。一个小时,跑了一亿多token。跟大家说说体感。

来自主题: AI产品测评
9767 点击    2026-08-01 10:40
实测美团CatPaw:这只猫爪,抓得还算稳

实测美团CatPaw:这只猫爪,抓得还算稳

实测美团CatPaw:这只猫爪,抓得还算稳

7月27日,美团正式上线了CatPaw,一个全场景AI Agent平台。准确说,是「内部练了三年,现在放出来给所有人用」。

来自主题: AI产品测评
11263 点击    2026-07-29 09:51
用K3和GPT的同款考题,测了Gemini 3.6 Flash的前端

用K3和GPT的同款考题,测了Gemini 3.6 Flash的前端

用K3和GPT的同款考题,测了Gemini 3.6 Flash的前端

谷歌的前端功底有多深,不需要任何人来认证。

来自主题: AI产品测评
9609 点击    2026-07-24 11:08
Qwen-Image-3.0效果炸裂?我反手扔了这9道题

Qwen-Image-3.0效果炸裂?我反手扔了这9道题

Qwen-Image-3.0效果炸裂?我反手扔了这9道题

千问说它可以帮我拼九宫格了,还是不同主题的那种。

来自主题: AI产品测评
7268 点击    2026-07-24 11:05
花整个下午实测秒哒3.5,PRO会员也挡不住服务器崩溃

花整个下午实测秒哒3.5,PRO会员也挡不住服务器崩溃

花整个下午实测秒哒3.5,PRO会员也挡不住服务器崩溃

WAIC 2026上,百度秒哒带来了3.5版本。据官方数据,秒哒累计服务超过3500万用户,创造了350万个具有商业价值的应用,每天有近20万人在使用这些应用解决真实问题。

来自主题: AI产品测评
8069 点击    2026-07-23 11:17