AI产品测评-这里有最详细的人工智能工具测评解析

AITNT-国内领先的一站式人工智能新闻资讯网站
# 热门搜索 #
1分钱9张图!DeepSeek视觉模型连夜实测

1分钱9张图!DeepSeek视觉模型连夜实测

1分钱9张图!DeepSeek视觉模型连夜实测

等了四个月,DeepSeek的多模态模型:deepseek-v4-flash-vision-exp,终于发布。我也是第一时间赶到现场,连夜开始实测。相比V4 Flash最大的不同,就是支持原生支持图片输入了,但图片生成当然还是没有的。

来自主题: AI产品测评
8150 点击    2026-08-22 14:27
开启Benchmark的Harness时代:15家学术机构联合发布HarnessEval

开启Benchmark的Harness时代:15家学术机构联合发布HarnessEval

开启Benchmark的Harness时代:15家学术机构联合发布HarnessEval

8 月 13 日,DeepSeek 开源 Agent Harness dsh,将 “Harness” 这个原本更偏工程语境的概念,推到了整个 AI 行业讨论的中心。

来自主题: AI产品测评
6459 点击    2026-08-19 14:37
AI做游戏有多野?实测最近爆火的 Spellcaster

AI做游戏有多野?实测最近爆火的 Spellcaster

AI做游戏有多野?实测最近爆火的 Spellcaster

不会写代码,能不能做出一款自己的游戏?

来自主题: AI产品测评
9663 点击    2026-08-19 11:45
独家 | 字节内测“漫剧创作工具”:搭载豆包大模型,支持20万字剧本上传

独家 | 字节内测“漫剧创作工具”:搭载豆包大模型,支持20万字剧本上传

独家 | 字节内测“漫剧创作工具”:搭载豆包大模型,支持20万字剧本上传

《读佳》获知,字节正在内测一款漫剧创作产品,名字就叫“漫剧创作工具”,Slogan“让创作更纯粹”,搭载豆包多个大模型。

来自主题: AI产品测评
6640 点击    2026-08-18 11:53
Seedance 2.5就够了?Flova全能六边形Agent,想补上创作者真正缺的“片场”|测评

Seedance 2.5就够了?Flova全能六边形Agent,想补上创作者真正缺的“片场”|测评

Seedance 2.5就够了?Flova全能六边形Agent,想补上创作者真正缺的“片场”|测评

上回说到,Seedance 2.5上线后,我们第一时间做了模型更新的能力测试。结果很惊艳,AI的指令遵循、运动效果、表演张力、人物一致性和全模态参考都有了大进步。

来自主题: AI产品测评
6702 点击    2026-08-17 15:39
第三方机构实测:Agent 场景下,Kimi K3 反超 GPT-5.6 Sol

第三方机构实测:Agent 场景下,Kimi K3 反超 GPT-5.6 Sol

第三方机构实测:Agent 场景下,Kimi K3 反超 GPT-5.6 Sol

Kimi K3 发布十天后,AI 原生云服务商 Together AI 公布了一份独立评测报告。

来自主题: AI产品测评
10031 点击    2026-08-10 15:06
实测阿里万有无界:让小万建群,它说人没齐死活不建

实测阿里万有无界:让小万建群,它说人没齐死活不建

实测阿里万有无界:让小万建群,它说人没齐死活不建

每天1000个注册名额,凌晨6点刷新,用完了就得进Waitlist排队,等短信通知。

来自主题: AI产品测评
9304 点击    2026-08-06 10:14
实测袋马:一句话生成的小程序,敢点「发布」吗

实测袋马:一句话生成的小程序,敢点「发布」吗

实测袋马:一句话生成的小程序,敢点「发布」吗

在AI应用生成这个赛道上,选手已经排到了两位数。腾讯有吐司,百度有秒哒,字节有Trae,阿里自家就有Qoder,现在又冒出来一个「袋马」。

来自主题: AI产品测评
6609 点击    2026-08-06 09:38
Doubao-Seed-Evolving 实测:把 edulab 交互技能做成 AI 教学课件

Doubao-Seed-Evolving 实测:把 edulab 交互技能做成 AI 教学课件

Doubao-Seed-Evolving 实测:把 edulab 交互技能做成 AI 教学课件

上一篇我用 Doubao-Seed-Evolving,把复杂 PRD 拆成可执行工程,做成了 AI 教学视频平台。那次重点是“知识驱动出片”:学科知识点 → 教学分镜 → 配音 → 动画 → 1080p 成片。

来自主题: AI产品测评
6765 点击    2026-08-06 09:37
1小时花一亿token极限实测DeepSeek-V4-Flash,得出7个结论

1小时花一亿token极限实测DeepSeek-V4-Flash,得出7个结论

1小时花一亿token极限实测DeepSeek-V4-Flash,得出7个结论

DeepSeek-V4-Flash风评冲爆了,原生支持接入Codex,而且还强化了Agent能力。我第一时间把它接进了Codex,用cc swich非常方便。一个小时,跑了一亿多token。跟大家说说体感。

来自主题: AI产品测评
9242 点击    2026-08-01 10:40
实测美团CatPaw:这只猫爪,抓得还算稳

实测美团CatPaw:这只猫爪,抓得还算稳

实测美团CatPaw:这只猫爪,抓得还算稳

7月27日,美团正式上线了CatPaw,一个全场景AI Agent平台。准确说,是「内部练了三年,现在放出来给所有人用」。

来自主题: AI产品测评
10641 点击    2026-07-29 09:51
用K3和GPT的同款考题,测了Gemini 3.6 Flash的前端

用K3和GPT的同款考题,测了Gemini 3.6 Flash的前端

用K3和GPT的同款考题,测了Gemini 3.6 Flash的前端

谷歌的前端功底有多深,不需要任何人来认证。

来自主题: AI产品测评
9177 点击    2026-07-24 11:08
Qwen-Image-3.0效果炸裂?我反手扔了这9道题

Qwen-Image-3.0效果炸裂?我反手扔了这9道题

Qwen-Image-3.0效果炸裂?我反手扔了这9道题

千问说它可以帮我拼九宫格了,还是不同主题的那种。

来自主题: AI产品测评
6839 点击    2026-07-24 11:05
花整个下午实测秒哒3.5,PRO会员也挡不住服务器崩溃

花整个下午实测秒哒3.5,PRO会员也挡不住服务器崩溃

花整个下午实测秒哒3.5,PRO会员也挡不住服务器崩溃

WAIC 2026上,百度秒哒带来了3.5版本。据官方数据,秒哒累计服务超过3500万用户,创造了350万个具有商业价值的应用,每天有近20万人在使用这些应用解决真实问题。

来自主题: AI产品测评
7577 点击    2026-07-23 11:17
速测 Qwen3.8 预览版:我用 1 小时,开发了套撒币系统

速测 Qwen3.8 预览版:我用 1 小时,开发了套撒币系统

速测 Qwen3.8 预览版:我用 1 小时,开发了套撒币系统

我刚刚 AGI Bar 小程序里建了一个共享钱包,并往里面充了 1 万块,未来 24h可点开领取

来自主题: AI产品测评
11017 点击    2026-07-20 15:20
Kimi K3 一手开发实测,前端、Agentic、长任务全面拉满 !

Kimi K3 一手开发实测,前端、Agentic、长任务全面拉满 !

Kimi K3 一手开发实测,前端、Agentic、长任务全面拉满 !

发布之前,我在 X 上看到有人说,测 K3 的感觉就像在测 Fable 5。虽然离 Fable 5 还差一点点 🤏,但超过 Opus 4.8 和 GPT 5.5 基本没有问题。在前端能力,K3 的提升非常明显,我已经用它复刻了前段时间爆火的独立工作室 Abeto 推出的一款 3D 网页游戏 《 Messenger》(ps. 音乐手动配的,主角模型是 K3 自己判断、自主去游戏官网找的)

来自主题: AI产品测评
9996 点击    2026-07-19 13:57
连夜实测 Kimi K3,建议改名 Kable

连夜实测 Kimi K3,建议改名 Kable

连夜实测 Kimi K3,建议改名 Kable

今天凌晨看到 Arena AI 更新 Code Arena 榜单时,我第一反应是有点意外。刚刚发布的 Kimi K3 拿到了 1679 分,排在全球第一,压过了 Claude Fable 5 的 1631 分和 GPT-5.6 Sol 的 1618 分。

来自主题: AI产品测评
10207 点击    2026-07-17 11:12
告别版本号!豆包首款无限进步模型:Seed-Evolving实测

告别版本号!豆包首款无限进步模型:Seed-Evolving实测

告别版本号!豆包首款无限进步模型:Seed-Evolving实测

大家好,我是袋鼠帝。 前几天,火山的朋友提前跟我同步了一个消息,说豆包Seed模型又更新了。

来自主题: AI产品测评
9583 点击    2026-07-17 11:05
豆包、WorkBuddy、QoderWork怎么选?我用8个真实办公任务把三家桌面Agent测明白了

豆包、WorkBuddy、QoderWork怎么选?我用8个真实办公任务把三家桌面Agent测明白了

豆包、WorkBuddy、QoderWork怎么选?我用8个真实办公任务把三家桌面Agent测明白了

过去半年,国产大厂扎堆发布一种新东西:桌面Agent。如果你最近在刷相关讨论,会发现 WorkBuddy、豆包专业版、QoderWork 这三个名字出现得特别频繁。如果一个普通办公用户今天就想选一款桌面 Agent,到底该先试谁?

来自主题: AI产品测评
11246 点击    2026-07-14 12:22
用Grok 4.5 连写了 7 个小项目,发现它最大的优势不是代码

用Grok 4.5 连写了 7 个小项目,发现它最大的优势不是代码

用Grok 4.5 连写了 7 个小项目,发现它最大的优势不是代码

7 月 8 日,xAI 发布了 Grok 4.5。马斯克给的定位很直白,「Opus 级别,但更快,更便宜」。

来自主题: AI产品测评
10582 点击    2026-07-14 11:08
实测完这个国产 AI 生图,我发现了下一个刷屏玩法

实测完这个国产 AI 生图,我发现了下一个刷屏玩法

实测完这个国产 AI 生图,我发现了下一个刷屏玩法

AI 生图最难的地方,早就从「生成一张好看的图」变成了「把那张差一点的图改对」。

来自主题: AI产品测评
9067 点击    2026-07-13 15:30
一个人+一个Agent,我把开店要的图全跑通了,方法全公开

一个人+一个Agent,我把开店要的图全跑通了,方法全公开

一个人+一个Agent,我把开店要的图全跑通了,方法全公开

大家好,我是冷逸。 前段时间,我设计了一家民宿「冷同学的院子」,视觉还算有点意思,不少朋友跑来问设计上的事。也有人问我:要是自己网上开店,有没有那种“够简单、说一句就能出设计”的电商工具?

来自主题: AI产品测评
7104 点击    2026-07-13 09:43
深度测评:Trae、WorkBuddy、ZCode,谁才是打工人真命天子?

深度测评:Trae、WorkBuddy、ZCode,谁才是打工人真命天子?

深度测评:Trae、WorkBuddy、ZCode,谁才是打工人真命天子?

我自己花时间,把三款主流国产桌面 Agent 从头到尾测了一遍:Trae、WorkBuddy、ZCode。用三个最日常的工作任务——做 PPT、分析表格、写小游戏,看看它们到底能不能帮普通打工人干活。这篇文章就是完整的实测记录,希望对你选工具有点帮助。

来自主题: AI产品测评
10735 点击    2026-07-12 10:08