刚刚,我们用千问创作做了一部「JoJo的奇幻买瓜」

AITNT-国内领先的一站式人工智能新闻资讯网站
# 热门搜索 #
刚刚,我们用千问创作做了一部「JoJo的奇幻买瓜」
7348点击    2026-08-31 15:26

8 月 24 日,阿里的 Wan 3.0 视频生成模型在千问创作 PC 端和千问 App 正式上线。同期出现在千问创作里的还有 Agent Teams 创作模式:用户提一个想法,一组分别扮演编剧、导演、美术、分镜师、配乐师的 Agent 自动组队,接力把它做成影视作品。


刚刚,我们用千问创作做了一部「JoJo的奇幻买瓜」


承载这两者的「千问创作」是千问近期上线的 AI 创作平台。它的定位是面向专业创作者的创意平台:Wan 3.0 及其满血的 Prime 版在这里全网首发,Prime 版生成更快、效果也更进一步;视频模型外,平台还汇集了 Qwen-Image-3.0 等阿里顶尖模型,视听两端的素材都能就地解决。产品侧则提供画布工作流与多种专业 Agent,AI 短剧、漫剧、营销广告、图像设计可以在同一个工作台里一站式完成。


是的,千问创作把模型、素材和流程装进同一个工作台。单看 Wan 3.0,这是一次模型升级,单段直出 30 秒、多模态参考、更低的单秒价格。单看多 Agent 协作,这是 Agent 范式在又一个场景里的延伸。两者相加,意义却非同寻常。


因为对专业内容生产来说,眼下卡住效率的环节,已经不是单条视频的质量了。卡脖子的是搬运


做过 AI 短剧的人大概都熟悉这套流程:一部三分钟的短剧拆成三四十个镜头,剧本在聊天窗口里写,角色四视图在生图工具里抽卡,分镜表落在表格里,再逐条把镜头描述翻译成提示词喂进视频模型;回来发现某个镜头中角色换了张脸,就得回上游改参考图,把下游重跑一遍。配音配乐在另外两个软件里,最后还要进剪辑软件对时间线。AI 在这里承担的是一个个孤立的工位,把工位串起来的人干的其实是制片主任的活。生成不难,难的是让几十次生成之间保持连续性


刚刚,我们用千问创作做了一部「JoJo的奇幻买瓜」


AI 短剧制作流程


这几年视频模型的能力提升很快,时长、画质、音画同步、角色一致性几乎每个季度都在刷新,但能力上限的提高并没有等比例地转化成生产效率。要完成一部短剧,还需要剧本结构、角色设定、分镜规划、跨集统筹和后期剪辑,这些工作量不随模型变强而消失,反而因为生成变便宜、可选项变多,管理成本还上升了。


行业已经意识到了这一点,昆仑万维和字节跳动都在做这方面的平台。整体来看,竞争的重心正在转向,目标正转向「把一次完整的内容生产组织起来」。千问创作这次把自研视频模型、自研图像模型和 Agent 编排装进同一个产品,是这条路线的一个最新样本。


刚刚,我们用千问创作做了一部「JoJo的奇幻买瓜」


千问创作手机 App 端入口及演示 demo


Wan 3.0:先把单镜头的上限抬高


要实现有效的多 Agent 协作,前提是每个工位的产出质量足够高。否则再精巧的分工,也只是把废片的产生速度提高了。


视频生成方面,千问创作接入了 Wan 3.0 视频生成模型及其 Prime 版,而 Wan 3.0 这一代的升级方向,目标就是要让生成结果可以直接使用。


刚刚,我们用千问创作做了一部「JoJo的奇幻买瓜」


首先是时长。单段最长 30 秒,意味着一次人物出场、一轮完整冲突或一段产品演示可以放在同一个镜头序列里生成,而不必用多个 10 秒片段来回拼接。须知,拼接是一致性问题的主要来源之一:换脸、道具漂移、环境音断裂、情绪重启,大多发生在接缝处。因此,时长的一大核心价值就是把接缝的数量降下来。


其次是参考的丰富度。除文本、图片、音频、视频四种基础模态外,  还支持 doc、xls、ppt、pdf、md 等文档格式输入,也支持网页链接。这一条在专业场景里的意义很大:广告片有品牌视觉规范文档,科普片有原始论文或 PDF,企业宣传片有产品手册。能直接读这些材料,等于把「人工把需求写成提示词」这一步省掉了一部分。


第三是一致性与镜头语言。Wan 3.0 在角色长相、场景布局、服装道具、声音和画面风格等维度支持像素级控制,可复刻参考资产,并能驾驭推、拉、摇、移等镜头运动,通过镜头切换和蒙太奇推进剧情。在第三方创作者的公开测试里,20 至 30 秒的短剧片段确实能在特写、全景、肩后镜头之间切换而不崩人物,暗场和大幅运动下的服装、站位也基本稳定。


刚刚,我们用千问创作做了一部「JoJo的奇幻买瓜」


Wan 3.0 的价格也极具竞争力。Wan 3.0 的 API 标价为 480P/720P/1080P 分别 0.3/0.6/1.2 元每秒;据千问方面提供的信息,会员限时 4 折起,720P 单秒低至 0.26 元。对需要靠量取胜的短剧、漫剧和信息流广告来说,单秒成本直接决定了废片可以承受多少次。


关于 Wan 3.0 的更多介绍可以观看我们之前制作的实测视频:


刚刚,我们用千问创作做了一部「JoJo的奇幻买瓜」


图像侧的搭档是 7 月 21 日发布的 Qwen-Image-3.0,支持最大 4.5k token 超长输入,可一次生成涵盖公式符号、几何图形、逻辑推导步骤等多元素融合的知识图解与复杂 UI 界面,并支持 12 国语言和 20 多款字体原生渲染。其提示词长度较前代提升了 4.5 倍,其一大重要应用场景正是影视短剧分镜:创作者可以像写需求文档一样完整描述画面结构、文字内容和排版细节。


刚刚,我们用千问创作做了一部「JoJo的奇幻买瓜」


当然,你也可以选择满血版 Qwen-Image 3.0 Pro,生成效果更佳。


对视频流程来说,这一条很关键。角色视图、场景参考图、道具图、分镜草图,这些都是视频生成之前必须先固定下来的资产。图片模型的可控性越高,视频阶段的抽卡次数就越少。


Agent Teams:从「写提示词」到「派活」


Agent Teams 要解决的是前面那个搬运问题。


它的交互起点只需一句自然语言。用户提出创作想法,系统自主拆解任务,把不同环节分派给承担导演、编剧、视觉设计、分镜师等角色的子 Agent,围绕剧情、人物、视觉风格和镜头表达展开协作。


刚刚,我们用千问创作做了一部「JoJo的奇幻买瓜」


千问创作的「人才市场」已经预置了 59 个 Agent,包含不同风格的导演、美术、编剧、歌手等,用户也可以根据需求自行创建新的 Agent


千问创作把这称为「自动组队」。后续的创意策划、脚本撰写、角色设定、分镜设计、画面生成、配音配乐直到成片制作,由这组 Agent 接力完成,用户可以在对话框里介入,修改创作方向。


网页链接和文档可以直接作为参考进入项目,当前附件支持 PDF、Word、TXT、Markdown 和 Excel 等。产品形态上,千问 PC 端和移动 App 端均提供了直达入口,Web 端也可通过 c.qianwen.com 直达。各端创作资产和项目互通,可以中途换设备继续。


实测:我们做了一部「JoJo 的奇幻买瓜」


我们给出的需求非常简单:一段「华强买瓜」的文字剧本,外加一句提示词:「将这个剧本做成视频,视频风格参考《JoJo 的奇妙冒险》」。没有分镜,没有角色设定,没有画幅要求,就是一个普通用户提需求的样子。


千问创作 Agent Teams 接手后的第一件事是派出创作助手,而这个助手先做了一轮任务分析,然后抛出了一个问题:视频要什么画幅比例?这恰好是我们在提示词里疏忽的参数。把「需求补全」放在任务拆解之前,比拿着残缺的需求一路跑到底要省事得多。


刚刚,我们用千问创作做了一部「JoJo的奇幻买瓜」


确认之后,创作助手把任务做了更细一层的拆解,并给出一份组队方案。这部片子需要四个工位:导演、插画师、视频师、剪辑师。


刚刚,我们用千问创作做了一部「JoJo的奇幻买瓜」


再次确认后,四个 Agent 正式加入项目。到这一步为止,我们输入的全部内容,仍然只有最开始那段剧本和一句话。


刚刚,我们用千问创作做了一部「JoJo的奇幻买瓜」


接下来是各司其职的接力。第一棒是导演,它把原始剧本拆成 11 个剧情点,并写出了一份完整的讲戏本。每个剧情点的情绪落点、人物动机、镜头意图都交代清楚。这份讲戏本本身就是流程被收拢进同一个上下文的证据,是下游几个 Agent 共同的参照物。


刚刚,我们用千问创作做了一部「JoJo的奇幻买瓜」


刚刚,我们用千问创作做了一部「JoJo的奇幻买瓜」


然后是插画师开工,产出角色与场景的视觉资产。


刚刚,我们用千问创作做了一部「JoJo的奇幻买瓜」


真别说,有那味儿了。这一步的产物是一份可以被下游反复引用的角色资产;后面十几个镜头的人物一致性,都锚在它们身上。


有了角色素材,轮到视频师逐镜头生成 JoJo 风格的片段。但它没有直接开始烧算力,而是先写了 12 条镜头提示词摆到我们面前,等待审阅和修改。


刚刚,我们用千问创作做了一部「JoJo的奇幻买瓜」


这里我们也能看出来千问创作 Agent Teams 的一大关键设计:Agent 之间传递的并非一段自然语言的转述,而是一份份可读、可改、可回滚的结构化中间产物:讲戏本、角色资产、镜头提示词表。它意味着这是一条每个工位都有明确交付物、且每份交付物都对人开放的流水线。


提示词示例:


刚刚,我们用千问创作做了一部「JoJo的奇幻买瓜」


同时,「先出提示词、再等确认」的逻辑也非常实用,毕竟视频生成是全流程里最贵、最慢的一步,一旦 12 条全部跑完才发现方向偏了,返工成本是最高的。把人的判断插在生成之前而不是之后,比多加几个自动化环节更实用。


说实话,这批提示词写得已经相当完整。但为了试出这套体系的韧性,我们决定强行加戏,提了一条修改意见:「将华强骑乘的重型摩托车改成有些残破的小电驴」,并从原版视频里截了一张小电驴的照片作为参考图丢了进去。与此同时,我们还把视频模型从 Wan 3.0-720P 切换成了 Wan 3.0-1080P。


刚刚,我们用千问创作做了一部「JoJo的奇幻买瓜」


这一下同时动了三个东西:镜头内容、参考资产和底层模型,这个 Agent Team 都稳稳接住了。


接下来就是成本最高的环节:视频生成。


刚刚,我们用千问创作做了一部「JoJo的奇幻买瓜」


12 条片段全部生成完成后,剪辑师上场,把它们拼接成了一段完整影片:


刚刚,我们用千问创作做了一部「JoJo的奇幻买瓜」


创作助手随后给出了整个项目的总结。


刚刚,我们用千问创作做了一部「JoJo的奇幻买瓜」


当然,须得承认,这一版成品并不完美,仍有不少瑕疵。但这恰恰是 Agent Teams 与「一键生成」类产品的分野所在:项目并没有在成片那一刻结束。我们可以退回到镜头生成环节,直接 @ 对应的智能体与之对话,单独重做某一段,而不必推倒重来。


刚刚,我们用千问创作做了一部「JoJo的奇幻买瓜」


下面是我们只微调了三个片段之后的新版本:


刚刚,我们用千问创作做了一部「JoJo的奇幻买瓜」


效果明显好了一截,而且这个优化过程是可以一直迭代持续的。


整体跑下来,我们的判断是:这套流程确实能把一个只有剧本和一句话的需求,推到一部结构完整、风格统一的成片,中间不需要在多个软件之间来回搬运资产。但它不是「一键成片」,从「能跑通」到「能交付」,仍然隔着人的验证和多轮优化。


这一点值得再往下想一层:为什么偏偏是视频这个场景,让多 Agent 协作看起来跑得通?


为什么是视频?


跑完这一遍,我想聊聊视频这个场景本身。


多 Agent 协作这个范式,过去一年在很多方向上被试过,落地效果参差不齐。回过头看,它跑得比较顺的地方有一个共性:任务本身已有成熟的分工协作范式


视频制作也正好满足这个条件。编剧、导演、美术、摄影、剪辑、配音,每个工种的职责边界、交付物格式、上下游接口,在电影工业里被打磨了一个世纪。Agent 的分工不需要重新设计,照抄剧组编制就行。分镜表天然就是一种结构化的中间产物,角色设定天然就是一份可复用的资产规格。相比之下,很多被硬拆成多 Agent 的任务,其实一个人就能干完,拆开反而会增加沟通成本。


但视频也有它特有的难处,而且这个难处恰好会在多 Agent 体系里放大。


代码类 Agent 之所以能自主迭代,是因为可使用编译器和测试用例来进行测试,结果很容易验证。


视频则不然。一个镜头「好不好」是主观判断,「接得顺不顺」需要人看完整段才知道,「感觉对不对」更是无法形式化。没有可以量化的验收标准,Agent 之间的接力就只能默认上游的产出是对的,错误会一路向下游传导,直到人在成片阶段才发现。


也正因为此,用户能在哪些节点介入、介入之后改动能否向下正确传播,或许比自动化程度本身更重要。回头看,Agent Teams 把讲戏本和 12 条提示词摆到用户面前等待确认,与其说是产品的贴心,不如说是这个场景的必然。


从这个角度看,Agent Teams 这类产品当下的真实价值,可能不在于「全自动」,而在于它把原本散落在十几个工具里的流程收拢进了一个上下文里。同一个项目里,剧本知道角色设定,分镜知道剧本,生成知道分镜。人不再是唯一的信息搬运工,而是来到了一个更接近导演的位置,只需提要求、看样片、下判断。


一个人能不能做出专业成片?


把「专业」拆开看,专业成片至少包含三层:技术可用性,画面不崩、声音同步、时长达标;叙事完整性,有结构、有情绪推进、有钩子;以及商业可交付性,符合品牌规范、能过审、能按时按预算交付。


第一层模型已经基本解决,第二层是 Agent Teams 这类产品正在解决的地方,方向对不对要看接力质量,第三层是反复修改、精确对齐需求、在有限预算内控制废片率;这一层目前仍然高度依赖人。


过去两年,AI 视频的竞争叙事一直围绕模型指标展开:谁的时长更长,谁的一致性更好,谁的单秒更便宜。这些依然重要,Wan 3.0 这一代的进步也确实落在这些维度上。但当单条视频的质量逐渐逼近可用线,差距会转移到流程的组织方式上去。


把编剧、导演、美术打包成一支可以被一句话调度的队伍,是对这个问题的一种回答。它还有很多没有被验证的边界,但这个方向看起来确实大有可为。


想上手的话,直接前往千问创作 PC 端 c.qianwen.com 即可开始(第一个 c 意为 create);也可以用千问 App 远程操控,创作资产与项目在多设备间互通,随时接着上一次的进度往下做。


文章来自于微信公众号 “机器之心”,作者 “机器之心”

AI转型,免费服务,就找AITNT
AITNT资源拓展
根据文章内容,系统为您匹配了更有价值的资源信息。内容由AI生成,仅供参考
1
AI代理

【开源免费】Browser-use 是一个用户AI代理直接可以控制浏览器的工具。它能够让AI 自动执行浏览器中的各种任务,如比较价格、添加购物车、回复各种社交媒体等。

项目地址:https://github.com/browser-use/browser-use


2
AI工作流

【开源免费】字节工作流产品扣子两大核心业务:Coze Studio(扣子开发平台)和 Coze Loop(扣子罗盘)全面开源,而且采用的是 Apache 2.0 许可证,支持商用!

项目地址:https://github.com/coze-dev/coze-studio


【开源免费】n8n是一个可以自定义工作流的AI项目,它提供了200个工作节点来帮助用户实现工作流的编排。

项目地址:https://github.com/n8n-io/n8n

在线使用:https://n8n.io/(付费


【开源免费】DB-GPT是一个AI原生数据应用开发框架,它提供开发多模型管理(SMMF)、Text2SQL效果优化、RAG框架以及优化、Multi-Agents框架协作、AWEL(智能体工作流编排)等多种技术能力,让围绕数据库构建大模型应用更简单、更方便。

项目地址:https://github.com/eosphoros-ai/DB-GPT?tab=readme-ov-file



【开源免费】VectorVein是一个不需要任何编程基础,任何人都能用的AI工作流编辑工具。你可以将复杂的工作分解成多个步骤,并通过VectorVein固定并让AI依次完成。VectorVein是字节coze的平替产品。

项目地址:https://github.com/AndersonBY/vector-vein?tab=readme-ov-file

在线使用:https://vectorvein.ai/付费

3
智能体

【开源免费】AutoGPT是一个允许用户创建和运行智能体的(AI Agents)项目。用户创建的智能体能够自动执行各种任务,从而让AI有步骤的去解决实际问题。

项目地址:https://github.com/Significant-Gravitas/AutoGPT


【开源免费】MetaGPT是一个“软件开发公司”的智能体项目,只需要输入一句话的老板需求,MetaGPT即可输出用户故事 / 竞品分析 / 需求 / 数据结构 / APIs / 文件等软件开发的相关内容。MetaGPT内置了各种AI角色,包括产品经理 / 架构师 / 项目经理 / 工程师,MetaGPT提供了一个精心调配的软件公司研发全过程的SOP。

项目地址:https://github.com/geekan/MetaGPT/blob/main/docs/README_CN.md

4
微调

【开源免费】XTuner 是一个高效、灵活、全能的轻量化大模型微调工具库。它帮助开发者提供一个简单易用的平台,可以对大语言模型(LLM)和多模态图文模型(VLM)进行预训练和轻量级微调。XTuner 支持多种微调算法,如 QLoRA、LoRA 和全量参数微调。

项目地址:https://github.com/InternLM/xtuner

5
prompt

【开源免费】LangGPT 是一个通过结构化和模板化的方法,编写高质量的AI提示词的开源项目。它可以让任何非专业的用户轻松创建高水平的提示词,进而高质量的帮助用户通过AI解决问题。

项目地址:https://github.com/langgptai/LangGPT/blob/main/README_zh.md

在线使用:https://kimi.moonshot.cn/kimiplus/conpg00t7lagbbsfqkq0