独家对话 Flova :脸萌、剪映后郭列再创业,做视频 Agent、但学的是 Claude Code

AITNT-国内领先的一站式人工智能新闻资讯网站
# 热门搜索 #
独家对话 Flova :脸萌、剪映后郭列再创业,做视频 Agent、但学的是 Claude Code
8482点击    2026-07-21 17:30

这是 Flova 团队的第一次公开采访。


Flova 很受关注,融资是一方面,两轮融资,红杉、IDG 和云九资本投资,累计超 8000 万美元,据说是目前视频 Agent 产品的最大融资。


独家对话 Flova :脸萌、剪映后郭列再创业,做视频 Agent、但学的是 Claude Code


而更主要的原因,可能是创始人郭列。郭列 2013 年做出脸萌,之后是 FaceU 激萌,2018 年被字节跳动以 3 亿美金并购,随后在字节孵化了轻颜相机、剪映和醒图。2025 年创业做 Flova,入局视频 Agent 赛道。


我们很好奇,在视频 Agent 这样一个可能唯二被验证了 PMF 的赛道,这样一个有着连续成功创业经验的创业者,和他的新团队,如何思考视频 Agent 的产品、竞争和商业化。视频 Agent 的核心壁垒在哪里,怎么才不会被模型吃掉,下一步打算做什么?


我们跟 80 后创始人郭列、 95 后增长和商业化负责人瑞瑞尔、 00 后产品负责人唐果一起聊了聊。相比较其他的视频产品,他们更关注的,却是 Codex、Manus 这些异业同行,「Coding  以及通用 Agent 确实在 Agent 上走得比较靠前,所以我们对 Coding 产品的设计会研究得多一点。」


也正因此,团队眼中的 Agent 的竞争,核心是持续观测用户和 Agent 如何完成共同创作,「做 Agent 产品,不是直接满足用户需求,是通过 Agent 去更好地满足。」


产品官网https://www.flova.ai/


以下是 Founder Park 与 Flova 团队的对话,经编辑整理。


01


当不了天才制作人,


就为创作者做一款好产品


Founder Park:Flova 的诞生由来是怎么样的?


郭列:从字节出来后做了一段时间的游戏创业,也一直在关注 AI,做游戏的时候也加了一部分 AI 实践。但那时候会觉得模型比较重要,应用层能做的事情相对有限。24 年底、25 年初的时候,DeepSeek 出来了,是个开源模型,当时就觉得应用层应该会有很多发挥空间,开始尝试自己手搓一些东西。


当时自己手搓了一个 3 分多钟的 AI 短片。用 Midjourney 做图,人物一致性非常不好,抽卡抽了很多张。生视频主要用可灵,效果也没有现在这么好。最后用剪映辅助剪辑,花了两周,每天晚上熬夜熬到很晚。


就觉得这个工作量很大,做起来也很累。如果用 Agent 做,可能是一个更好的方式。所以开始搭 Agent 的 demo。做到一半,GPT Image 1 出来了,解决了一部分角色一致性问题,不然还要用 LoRA 训练去保持一致性,会更复杂。图片模型越来越好,去年视频模型也卷得厉害,效果慢慢上来,我们就一直往下做了。


Founder Park:为什么是视频?


郭列:主要还是自己感兴趣。我经常看电影,也看得挺多,挺喜欢电影和剧本这些东西,自己还去上过一些课程,包括剪辑、视频拍摄和剧本,那时候还不是 AI 相关的。后来就发现,其实可以把它产品化,而产品化这个事情,是我过往经历里相对擅长的。


Founder Park:当时摆在你面前的还有另一条路:用 AI 把游戏的制作流程和玩法重新做一遍。为什么没选?


郭列:游戏这段经历,跟我之前互联网的经历有很大的差别。游戏跟电影比较像,它比较看导演或者制作人,需要一个天才导演、天才制作人。通过游戏这次创业,我发现自己并不是那个天才制作人。


现在做 Flova,我对 AI 视频方向感兴趣,对影视行业也感兴趣,但你真的让我变成一个导演,我觉得可能也挺有挑战的。更多的还是会发现自己擅长做什么。如果你能做一个帮大家做出很好内容的产品,本身也是很有价值的。天才导演是更难的事情,那是不同的能力模型。


Founder Park:到什么时候觉得这个方向走通了?


郭列:我们应该是 5 月份开始做 Demo。当时出了一些成片之后,就觉得这个方向出来的效果还挺惊艳。比起手搓可能差远了,但比起你花的时间和最终出来的视频效果,是有一个非常大的提升。真正开始产品测试,到了 2025 年 9 月初。


唐果:之前手搓的时候会花大量时间做素材管理和收集,可能要根据不同镜头去排不同的素材。天天晚上熬夜,做很多不愿意做的事情。Manus 出来之后,我们在想能不能通过 Agent 的方式来做视频,能不能帮我们减少在这些事情上的花费。当我们做出 Demo 的那一刻,发现自己能够更多地享受制作视频的快乐,那就是一个非常明确的信号。我们意识到可以这样做视频,和原本手搓视频的时代是一个完全不一样的 Moment。


Founder Park:从数据角度来看,你们什么时候觉得找到了 PMF?


瑞瑞尔:不管是用户创作内容品类的变化、单个用户消耗 Token 的观测,还是用户心智从试模型到持续做内容创作,这三条线都出现了明显的 PMF 拐点。当然这也跟模型本身的演进有关系,尤其是 Seedance 2.0,它很好地提高了创作的下限。


02


视频 Agent 做指挥官,


用户做决策和判断


Founder Park:市面上有很多视频类的产品,Flova 和别的有什么不一样?


瑞瑞尔:我们认为这个行业上的产品,根据业务演进的阶段,大概有三类。


第一类是模型厂商的 C 端应用。核心价值是自身模型的 Showcase,最佳商业模式就是卖 API。因为围绕自家模型构建,缺少第三方模型,对用户的完整创作体验是有缺失的。


第二类是模型一站式聚合平台。根据交互形态,会演变成对话式和画布式两类。但你会发现,它们的使用逻辑跟第一类是一样的。用户要自己去理解不同模型的上限是什么,提示词技巧是什么,一致性怎么保持,分镜怎么拆。需要用户对模型有很清晰的理解,对 Workflow 也有很多了解,才能做出高质量内容。


第三类是视频 Agent。不管是对话还是画布,都不是我们的本质,这只是人机交互的一种协作形式。真正核心的是 Agent 能够去懂用户的创作目标,懂不同模型的 Knowledge、不同工作流、不同美学风格的 Skill。它能极大降低用户的创作门槛。


Founder Park:那怎么区分聚合平台和视频 Agent?


瑞瑞尔:区别不在于画布还是对话,而在于谁来组织和执行创作过程,有没有解放用户的生产力:用户的注意力是在打磨提示词本身,还是回到了他想讲什么样的内容。聚合平台把模型和工具操作交给用户,用户仍然要自己规划、指挥和操作;视频 Agent 会理解用户的创作目标,接手大量执行和管理工作,让创作者把更多精力放回内容、创意和审美判断上。


唐果:单点的模型聚合平台,本质上每一次点击生成都是一次独立的开始。用户要自己做很多信息管理,比如片段和片段之间怎么组织。但我们知道,视频创作的核心难点不是生成单个好看的片段,而是把多个好看的片段组织成一个一致的作品。


这个过程中夹杂着创作者很多自己的判断。你可能会探索和尝试很多角色和风格,最后哪一个形象是你认可的?哪一个风格是你希望在整个创作流程中持续保持的?对创作 Agent 来说,非常重要的一点是不能把每一次生成当做一次孤立的开始,核心是要能帮用户整理素材、做版本管理,让创作者感觉和 Agent 一起在协作,甚至被 Agent 推着往前走,一起把完整的项目落实下来。


独家对话 Flova :脸萌、剪映后郭列再创业,做视频 Agent、但学的是 Claude Code


郭列:Agent 其实是把用户所有创作内容的上下文放在一个容器里。比如 10 个镜头的某一个镜头要修改,这个修改可能牵连到其他镜头、其他角色、其他音频生成,这些全在一个上下文里面,Agent 会更了解。如果用户要大幅修改,比如删掉一个人物,可能涉及所有镜头的修改,这些也是 Agent 可以做到的。它在做一个全知上下文的控制。


Founder Park:画布和 Agent 是冲突的吗?


瑞瑞尔:不冲突。我们也有各种交互方案的尝试,包括画布。交互方式只是阶段性的手段,我们的目的一直没变,怎么让用户在当下阶段把模型的最佳性能发挥出来,做出最高上限的内容效果。核心看的是有没有解放用户的生产力,用户的注意力是还在打磨提示词,还是回到了他想讲什么内容、围绕内容做发散收敛。


唐果:画布本身不是问题。对很多设计类用户来说,拖拽、摆放、放大缩小是非常自然的交互。画布本质上是一个非线性的创意发散空间。但你直接把非线性的创意发散空间带到 Agent 的设计里,可能会产生一些问题。Agent 需要一个有序的、有结构化的、可以索引的容器。


所以我们核心在探索的是,用户需要非线性发散的创作空间,Agent 需要有序可索引的context 管理,这两者之间怎么达到聚合?用户操作的工作台,和 Agent 最后理解的 context 数据结构,要能达到信息转化。


郭列:主要还是用户群体的差异。专业用户用画布更符合习惯,他们更希望在一个平面上发散。对小白用户来说,故事板的顺序更友好。但这些只是内容的展现方式,不是我们最看重的部分。我们更看重的是 Agent 怎么组织和管理这些内容资产,可以比较好地去调度它。


我们也看到了一些很有趣的用户行为。有些用户几乎只通过右侧的对话框完成创作,左边的辅助功能很少使用,所有修改都直接用自然语言告诉 Agent。随着 Agent 越来越智能、模型成本越来越低,我们认为这种创作方式会越来越普遍;未来需要用户亲手完成每一步操作的情况,反而可能会越来越少。


03


视频 Agent 的核心是资产管理、


以及人的 Taste


Founder Park:Flova 的 Skill 和通用 Agent 的 Skill 有什么区别?


唐果:整体的逻辑来说是一样的,通过渐进式披露节省上下文。当决定要用这个 Skill 之后,可以把更多业务知识给到 Agent。但因为服务的 Agent 不一样,定义的工具不一样,Skill 的工作方法就不一样。


郭列:我们把 Agent 所有的原子能力做了拆分,创作者可以灵活调动这些工具,自定义出好用的 Skill。做好了一个 Skill 之后,这个 Agent 有可能就是他自己的 Agent,不是我们设计的,因为所有提示词、喜好、流程都是他自己来定义的。


创作者给我们的输入比我们本身更多,他们的很多玩法出乎我们意料。我们想做的更多是帮他审核,找出可能有问题的地方,保证这个 Skill 在平台上没有 bug、运转顺畅。创意本身还是由超创和用户自己提供的。


独家对话 Flova :脸萌、剪映后郭列再创业,做视频 Agent、但学的是 Claude Code


Founder Park:前期覆盖哪些场景的 Skill,是怎么判断的?


瑞瑞尔:官方 Skill 前期会优先覆盖那些成熟、反复出现的创作需求,比如拉片、故事影片和短剧,为不同场景提供一个可以直接使用的基础版本。


在这个基础上,Skill 大概会沿着三个方向继续演化。第一类服务要求更高的专业用户。他们通常不会直接照搬官方 Skill,而是会根据自己的创作习惯、团队流程和质量要求,改造成更适合自己的版本。第二类是内容玩法创新,比如女友视角、互动视频或当下流行的创作主题,让新用户更容易体验到 Agent 能做什么。第三类是审美和风格,比如围绕某种镜头语言、视觉风格或导演表达方式进行定制。


所以我们判断一个场景是否值得做成 Skill,不只是看它属于短剧、MV 还是口播,更重要的是看其中有没有可以反复复用的创作方法,包括任务怎么拆、工具怎么用、生成顺序怎么安排,以及哪些地方需要用户做判断。官方提供基础版本,专业创作者再在真实项目里不断修改和 完善。


Founder Park:创作没有标准答案,Skill 有吗?


唐果:创作本身就是多元的,不会存在一个 Skill 就是某个场景最好的效果。Skill 只是让 Agent 进入不同创作场景的一种方案,能沉淀某一类视频的专业经验,告诉 Agent 在这个场景中通常怎么拆解任务、哪些工具比较重要、哪些地方需要批量执行。


但真正重要的审美判断,还是在用户自己的个性化项目里落实。让创作最终成为创作者自己的东西,这才是好的 Skill。真正有价值的 Skill,是在真实项目中被反复修改和验证出来的。官方和超创一起搭建标杆 Skill,用户在生产项目中验证它确实能降低创作成本、提高质量,自然会有动力去复用、改造和传播,整个生态才能养起来。


Founder Park:视频 Agent 的上下文管理和 Coding Agent 的核心区别是什么?


唐果:最核心的区别就是模态存储的逻辑不一样。Coding 里所有东西本质上都是文件,可以用比较成熟的 Git 做版本管理。


但多模态的数据怎么做存储和管理,逻辑完全不同。比如一个元素图,可以同时被引用为镜头 A 的参考图,又可以作为另一个镜头的关键帧。视频 Agent 里所有的 context 都是多模态的,图片、视频、用户上传的素材,甚至你的 Prompt 都有可能进入上下文。


第二个差异是版本管理。创意的过程就是不断发散、再不断收敛。用户选的版本,不是一开始生成的那个,也不是最后一次生成的,而是中间某次灵光乍现生成出来的。怎么做好版本管理、怎么辅助用户的决策,是和通用 Agent 完全不一样的点。


Founder Park:Memory 管理在视频 Agent 里的优先级怎么样?


唐果:一般 Agent 做 Memory,大致有两种方式。一种是在任务进行过程中,让 Agent 主动把重要信息写进文件或备忘录;另一种是任务结束后,回看之前的对话和执行过程,从中提取用户偏好、关键事实和长期有用的信息,之后再按需取出来。


视频 Agent 也需要这些能力,但它要记住的不只是用户说过什么。一个视频项目里还有大量多模态信息和版本关系:最终选定了哪个角色形象,哪些素材被哪些镜头引用,用户在多个版本里保留了什么、放弃了什么,以及哪种风格需要在后续内容里延续。对于几百集、几千个镜头的项目,这些信息还需要跨镜头、跨集甚至跨项目继续使用。


另外,团队的创作方式也需要被沉淀。比如怎么拆剧本、怎么确认角色、哪些环节需要人工判断,可以通过 Skill 让 Agent 逐渐适应这套工作方式。所以视频 Agent 的 Memory 不只是对聊天记录的提取,而是对素材、版本、用户判断和创作方法的持续继承。


Founder Park:视频 Agent 能像 Coding Agent 那样 Human on the loop吗?


唐果:首先,两个场景不一样。Coding 为什么对模型厂商更好训?从训练数据集你就能看出来,它有一个更可被验证的答案,奖励模型好训,结果是否符合预期也好验证。


但创作领域不一样,很多偏好你要用自己的眼睛才能看出来。而且人本来就是一个很好的多模态「模型」:我看到那些图,自然而然就知道哪一个是好的;但要看一个超长的文本,认知负荷是比较大的。


第二点,是怎么让人进入心流的状态。Coding 里我可以托管一个任务,就撒手去做别的了。但在创作里,要让人和 Agent 都进入心流:Agent 有一个好的工作环境,自由地检索上下文、使用工具,把结果写回创作过程;人有一个足够直觉的工作台,并行生成很多个镜头,检视 Agent 的工作,把相同镜头的不同版本放在一起,看哪一个更符合自己的直觉判断。


关键在于信息同步。一个比较好的产品容器,应该是 Human 和 Agent 共同工作的容器:让 Agent 自由地执行,让用户自由地选择和确认,把决策成本降到最低。至少在创作领域是这样。


Founder Park:往前想一步,更合理的交互形态会是什么样?


唐果:至少在创作领域,现阶段的解法就是,人要参与很多审美上的决策。这句话在 AI 界说得有点老生常谈了,就是 taste 是取代不了的,特别是多模态的 taste,非常依赖人本身。


当然,不同的用户有不同的创作方式。也有用户更偏好托管,比如把任务托管给自己的 Codex 或者 Claude Code,让它们来操纵 Flova 的 Agent。所以我们也在做对应的 CLI。真正重要的,还是观测好用户和 Agent 到底在以怎样的方式协作,端内决策也好,CLI 托管也好,观测好了,才知道怎么为 Agent 打造更好的工具、权限和 context 组织。


04


真正的壁垒,


是持续观测用户和 Agent 如何协作,持续进化


Founder Park:怎么看待现在视频 Agent 赛道的竞争吗?


瑞瑞尔:谈不上竞争,现阶段还是一个高速增长的市场,供给端远远没有饱和。对创作者来讲,能力工具远远没有饱和,还有大量需求没有被更好地满足。不管是 Skill 不够智能,还是 Agent 的能力还不够强,每一块都有足够的增量空间可以往前走。


Founder Park:Skill 生态会是视频 Agent 的壁垒吗?谁的 Skill 更丰富、更能解决问题,会是竞争的关键点吗?


瑞瑞尔:可能都叫 Skill,但 Skill Builder 的体验是不是足够优化、加载 Skill 的逻辑是不是足够智能,这些才是产品的内核,不只是 Skill 本身。


所谓的竞争优势,只是客观阶段下一个静态的竞争事实。当下我们认为 Skill 是一个很好的应用解法,不管是串联不同层次的用户,还是串联平台跟用户,都是比较好的手段。但它不是所谓的业务壁垒。


郭列:Skill 是现在这个 AI 时代大家比较认可的一个技术方案,但早期也有很多别的方案,包括 Codex 和 Claude Code 也有插件或其他方案。真正的壁垒还是我们能根据时代的技术不断迭代。Skill 现在看起来还比较好用,但有可能未来技术迭代,又会有其他的东西。


唐果:真正的壁垒还是能够持续地去观测用户、观测 Agent。这两者对于我们来说都是全新的命题和挑战。原来的用户不会和 Agent 有真正的协作,你需要理解现在的用户到底怎么和 Agent 协作。原本也没有 Agent 这种产物,你也要去观测 Agent 在创作过程中怎么理解这件事情。只有密集地对双方做观测,才能知道什么是对的,不断做调整。现在还在非常早期的阶段,要保持好奇心和积极调整的状态。


Founder Park:所谓的观测具体怎么做?


唐果:观测分两层。第一层是对用户的观测。传统互联网更多通过技术埋点,看用户做了什么、在转化漏斗的哪一步流失;但在 Agent 产品里,除了行为层,我们还要理解用户的意图,比如他为什么选择或拒绝某个结果、一次修改背后真正想表达什么。第二层是对 Agent 的观测,有点类似算法里的 Trace。看 Agent 怎么理解任务、怎么做 Reasoning、决定调用哪些 Tool,调用过程中遇到了什么问题,又是怎么容错和调整的。


Founder Park:把「人和 Agent 之间的摩擦」往下拆,你们到底在优化什么?


唐果:核心是三个部分。第一是面向用户的设计,怎么让用户以更小的成本理解 Agent 在做什么,用户的操作能否积极响应。第二是面向 Agent 的设计,围绕 Agent 做 Harness 和各种调整,让它能在有序空间里充分发挥。第三部分是面向协作,Agent 和用户之间能做比较好的信息传递,降低摩擦。


让用户干得开心,让 Agent 干得自由,让两者之间的信息得到最好的同步,这三件事情同时做好。


Founder Park:那你们的竞品是谁?


瑞瑞尔:我们更多的注意力在一些异业同行上。用过我们产品的用户,如果也用过 Codex 或 Claude Code,会感受到有这些产品的影子。之前也会比较关注 Manus。


郭列:我们自己不特别关注竞品,更多还是关注用户。Coding 确实在 Agent 上走得比较靠前,所以我们对 Coding 产品的设计会研究得多一点。


Claude Code、Codex 比较早地把 Agent 放进了真实的项目环境里,没有让 AI 停留在「回答问题」,这是它们做对的地方。


Agent 的核心是在一个真实环境里持续把任务往前推进:理解目标,读取当前状态,调用工具行动,遇到问题时调整路径,最后把结果交给人 review、接管和继续推进。代码库、文件、diff、测试、git、权限、review,这些共同构成了 Agent 的工作环境。用户也能看清楚它做了什么、改了什么、结果能不能接受。


这里面有很多 Agent 设计哲学值得参考,比如渐进式披露、用 Sub-agent 做上下文压缩。但这些方法最后都是为了同一件事,让 Agent 在复杂项目里更稳定地行动,也更容易被人理解、接管和纠偏。


Flova 想在视频创作里做类似的事情。视频 Agent 不应该只是生成一段视频,而是进入一个视频项目,理解素材、版本、分镜、时间线和用户判断,调用工具推进任务,在工程边界内自由探索,同时用户随时可以比较、选择、修改和接管。我们真正学习的不是某个具体功能,而是让 Agent 成为人创作过程中的协作者。


做 Agent 产品,不是直接满足用户需求,是通过 Agent 去更好地满足。我们给了 Agent 很大的自由度,它不是一个工作流,有自己的调度和想法。如果原来产品经理是洞察用户需求,现在就是要同时洞察用户需求和 Agent。


Founder Park:这样说的话,Agent 本身也是你们的用户?


郭列:这里其实有两件事容易混在一起。


第一件事,是我们在设计 Flova 自己的视频 Agent。它不是用户,用户还是创作者;它更像产品里真正负责干活的人。用户告诉它想做什么,它负责理解任务、找到合适的素


材和工具,再一步步把事情完成。所以我们不仅要观察用户用得顺不顺,也要观察这个 Agent 干活顺不顺、经常卡在哪里,再想办法让它做得更好。


Claude Code 给我们的启发是,有些问题随着模型变强,自然就会改善;有些问题则需要产品提前做好准备。我们要通过观测把这两类问题分清楚:哪些可以等模型进步哪些必须由我们自己长期解决。


第二件事,是让外部 Agent 使用 Flova。Flova 也提供 CLl,Codex、Claude Code 这类 Agent 可以直接调用 Flova 完成视频创作。在这个意义上,Agent 确实也会成为 Flova 的使用者之一,但这和 Flova 自己的视频 Agent 是两件不同的事。


05


视频 Agent 的大众普及还没到来,


先做有溢价的专业场景


Founder Park:Flova 的典型用户画像是什么样的?


瑞瑞尔:我们对用户的视角有很多切分方式。一种是按创作内容类型:短剧、漫剧、AI 电影、TVC。另一种是按创作动机和身份:成熟的工作室从业人群、传统设计影视行业的转型人员、学生,或者 AI 导演。


如果从全球市场看,确实有差别。国内因为视频模型单价相对贵,用户如果做一个 1 到 2 分钟的视频可能要花小几百人民币,所以用户更多偏职业化的短剧、漫剧工作室,或者已经拿到自媒体正反馈的创作者。美国更偏营销类的社媒创作者、品牌的 DTC 人群。日本偏兴趣驱动的,做 CG 类、IP 角色的持续故事构建。目前我们用户量 TOP 3 的地区大概是美国、日本和中国。


郭列:中国市场其实比想象的要好,主要还是因为短剧、漫剧这个行业变成了生意,大家愿意投入。其他市场可能还没有形成产业。


Founder Park:很多人对 AI 应用悲观,是因为解决不了 token 成本的问题,毛利和增长的矛盾,每个新用户都带来成本。这是一个长期存在的问题吗?


瑞瑞尔:当下的 C 端生成式 AI 业务都一样,大家都在回答这个问题。最关键的可能是两个指标。


第一个是 ARPU。它体现了用户的付费能力,也决定着你能够提供的算力补贴的天花板:用户对你这个场景,是只能付 10 块钱,还是能付 200 块钱。这也是为什么行业上越来越多的产品,开始主打更专业的场景,因为专业的场景才有溢价。


第二个指标是付费渗透。你服务的群体里,到底有多少人有明显的商业闭环或者强付费动机,这决定了免费用户尝鲜和持续付费用户之间的平衡,不至于免费用户把整个成本拖垮掉。


Founder Park:那你们会在什么节点,去做大规模的用户增长?


瑞瑞尔:至少在国内,我们认为视频 Agent 的大众普及阶段还没有到来。普通用户想做一个日常表达的视频,比如记录一件喜事,愿意为单条视频花的钱大概在几块到十几块之间。但现在的实际成本是几十到上百块,这个错位还没有消除。


郭列:但我们看到一个趋势,抖音、B 站、YouTube、TikTok 上 AI 视频的播放量在不停上涨。随着模型越来越好、成本越来越低,这个占比会涨得很快。


瑞瑞尔:海外的扩展趋势比国内要快,成本是一个主要制约因素。我们有一个日本用户专门发了个帖,说他把 20 年前做的一个梦终于做出来了。这种用户是有创作需求的,但之前没有创作工具能帮他实现。


Founder Park:短剧是现在商业化跑得最快的场景。它会是未来一年你们收入和增长的主要来源吗?


瑞瑞尔:我们不太称呼这个品类叫短剧,我们更多会觉得这是高质量的 AI 短片。


早期的 AI 视频,比较多在科技感、猎奇类、搞笑类的方向。因为那个时候 AI 视频在日常镜头、人物动作、真实情感的演绎上都有明显瑕疵,用户就去做传统影视拍摄成本比较高的内容:特效场景、宏大叙事、奇观画面,放大 AI 视频的优势,弥补它的短板。


但现在 AI 视频整体的下限,已经越过了一个技术门槛:画面质量、人物表现、镜头连贯性,都来到了比较高的基线。对消费者来讲,他是能够比较沉浸地去看创作者讲述的剧情和故事的。内容趋势就从「展示 AI 能做什么炫酷的东西」,回到了「它到底在讲一个什么样的故事」。所以我们服务的不是某一种具体的内容形式,短剧、漫剧还是宣传片,而是用户怎么更愿意用 AI 做好他的叙事能力、内容的完成度,和他最终想表达的东西。


Founder Park:如果短剧这个行业突然垮了,生产和商业消费降了很多,对你们有影响吗?


瑞瑞尔:首先我们不认为某一个行业会突然垮掉,或者突然大爆发。我们大部分的创作者,做的是高质量 AI 故事短片,我们对特别职业化的短剧依赖没有那么高。


而且特别职业化的短剧创作者,本身对工具的依赖也没有那么大。他们会偏向算账逻辑,做一系列提示词模板,招对应的人批量跑。从他的效率角度讲,这比依赖智能工具更划算,他会回到更传统的内容制造业,用公司的组织运作方式去消解痛点和成本。


Founder Park:所以职业短剧工作室,可能本来就不是视频 Agent 产品的标准用户。


瑞瑞尔:对。当然短剧创作者也有不同的分层,我们也确实有不少偏短剧、漫剧的创作者。


Founder Park:怎么看 AI 视频和传统影视的关系?


瑞瑞尔:我们关注的内容是高质量的短片,最终回到创作者的叙事上。AI 只是一种解决的手段,视频背后的内核是一样的。你剪辑软件用剪映还是达芬奇,还是现在用 AI 生成的方式,回到用户在故事上的表达,其实是一样的。只不过这个方式会重构他的创作流程,所以会重构类似我们这样的创作工具。而且因为技术更加普适了,创作端的群体又会有指数级的变化。


当有一天,大家看到 AI 视频不叫「AI 视频」的时候,这个事才真正繁荣普及了。就像你现在看电影和电视剧里的 CG 特效片段,不会再专门标注它是 CG 特效了,一样的逻辑。


郭列:AI 它只是一个工具,帮你实现你的想法。最终的想法,还是在这个人的品味和判断,他觉得这个故事内容是不是足够有趣,这个画面是不是足够满意,在他的审美上。


Founder Park:这个判断会影响产品设计吗?如果你们坚信人不可被取代,就会保留人做判断的环节,而不是让用户说一句话,直接出一个 1 分钟的视频。


郭列:是的。Agent 越往后做,它应该越去跟人讨论创意本身,花很多时间帮你讨论剧本,这个故事怎么更有趣,这个画面还有哪些表达方式更好,然后把执行的事情全都交给 Agent。它是一个共创。


唐果:AI 到来首先带来的,肯定是生产力的极速爆炸。以 Coding 举例,原来要很久才能实现的东西,现在一两天就飞快解决了。但生产速度的提升,并不能带来高质量的作品。


一句话创作一个短片,能不能出来?以后肯定可以,现在也可以。但它是不是一个高质量的创作?能不能给视频的消费者、创作者带来真正的价值?我觉得带不来。人只有在这个过程中发挥自己的审美和判断,把品味真正带出来,那个东西才是有价值的。Agent 只能够帮你更好地把你的品味发挥出来。


06


视频 Agent 的竞争,


是如何组织多模型协作的系统


Founder Park:会担心模型厂商的视频 Agent 吗?


瑞瑞尔:越靠前的产品,比如模型 C 端应用或单纯的聚合平台,不可避免会有这个问题。但我们会认为 Agent 的应用价值是足够深的。


视频 Agent 是一个比较综合型的产品,它不是完全只调用大语言模型。图片模型、视频模型、音乐模型、LLM 各自的 SOTA 都分属不同厂商。这不像 Coding,可能主要依赖单一模型。最终的竞争核心看的是应用公司怎么把这些不同的模型组合在一起,搭建出更强的 Agent 能力。


郭列:而且做好 Agent 产品本身也挺有挑战。模型还在发展早期,随着模型越来越成熟,模型之间的差异性也会百花齐放,包括成本、各自擅长的方向。Agent 最终会在模型变得越来越好的同时,变得越来越好用。可能会像移动互联网一样,有很多应用出来。


Founder Park:但今年确实能感觉到视频模型有垄断的趋势。


瑞瑞尔:我们会认为这是阶段性现象。以视频模型为例,现在来看 Seedance 2.0 过于断代领先了,但同样的例子发生在 Sora 一代的时代,它当时推出 DiT 架构,各家还没有做 DiT 架构的时候,差距也很大。但一旦大家都具备了同一个架构水平,模型又会百花齐放。


模型本身效果、生成速度和成本是一个不可能三角,有不同公司在不同业态上做侧重。对我们这种应用公司来讲,模型有不同特质,其实更友好。


郭列:长远来说肯定是百花齐放。但视频模型市场未来应该会像 Coding 模型一样,有不同能力、不同价格定位的模型,整体水准肯定有很高的提升。也有成本型选手会追上来,比如智谱 GLM-5.2 效果已经开始接近了,成本便宜很多。


Founder Park:会担心受制于模型吗?比如说成为模型的分发商?


瑞瑞尔:模型跟我们这种 Agent 应用的关系,以及模型变强,Agent 应用的价值怎么体现。从实践角度讲,模型跟我们是一个正向飞轮,模型变强,我们可以发挥的空间也更高。


这个是跟外部视角一个反认知的。大家下意识会觉得模型变强了,仿佛你的应用价值变薄了,但实际上是反的。模型变强,往往意味着我们在服务用户的创作精细度、可控的内容维度、工作流的复杂度上都有质变。这些都是需要应用层让用户更友好地调用的新能力。


从用户端来看也是这样。模型变强,用户可以产出的内容上限也会变高,对内容的评判维度也会变高,整体基线是在跃迁的。整体是水涨船高的感觉,每一次模型变强,其实是让应用服务用户的能力变得更强。


郭列:举个具体的例子。比如 Seedance 2.5 突然支持 50 个参考图,可以把视频效果做得非常好。但让一个人找 50 个非常一致的图像或内容做参考,来保持生成效果,其实挺难的。这很适合让 Agent 帮他精控生成这些素材。模型变强了,Agent 发挥的空间也会更大。


07


AI-Native 组织的关键,


是打通上下文


Founder Park:团队内部现在怎么做产品迭代?跟你之前经历的互联网团队有什么不一样?


郭列:我自己感受挺深的。因为我是从互联网时代过来的,AI 对整个团队产研和设计的影响非常大,分工方式也变了。


我们会尽量共享上下文,技术同学、产品同学把需求文档或代码放在同一个上下文里。产品同学自己去 Coding 一个相关功能,技术同学做 review。甚至技术同学会根据这个方式,把代码做一些优化,让设计和产品更好地在某一个层做修改,他们来做最后 review。设计可以直接在 Coding 基础上调好设计。


唐果:我的感受可能跟不太一样,郭列横跨了传统互联网到 AI 时代,可能更能感受到技术范式和组织协作方式是怎么一步步变化的。像我这样的 00 后,真正开始工作的时候,AI 已经是生活和工作里很自然的一部分,所以不会觉得某件事必须沿用过去的流程,也不会为了证明自己 Al Native,就把所有事情都交给 Agent。我们更关心的还是怎样最高效地解决问题:复杂需求可以让 Agent 梳理、实施和 Review,但如果直接和旁边的研发同学聊几句更快,那就直接沟通。AI 是提高效率的手段,不是团队追求的形式;真正的 Al Native,是始终选择更快、更好的解决方式,从第一天起就把 Al 当作一种理所当然的方式。


Founder Park:AI 对团队协作最大的改变是什么?


瑞瑞尔:我觉得是上下文共享带来的几个质变。


第一个质变是产品上下文共享。我们基于 GitHub 代码仓库做了充分的上下文共享。在传统互联网公司里,想知道产品某个功能的来龙去脉,通常要问到具体研发,他再去拉代码 review 或翻需求文档。现在所有人共享同一个上下文,任何职能的成员都能基于自己视角快速理解产品。比如一个市场同学想了解某个功能在特定用户场景下的状态,AI 还会基于他的专业视角结合产品上下文给出建议。


第二个质变是用户 trace 观测的上下文共享。传统业务里提一个用户洞察需求,要么看原来的埋点有没有对应的信号,要么发问卷做调研。现在我们的 trace 里包含了 Agent 的工具调用、用户的意图表达、项目的详细步骤,能做非常深度的分析,帮助快速迭代业务策略。这种是上一个时代的组织协作没办法具备的,不取决于人与人之间的协作方式,也不取决于 AI 的智能,更多来自于上下文具备了共享的可能性。


上下文的充分共享跟流转,带来了协作效率指数级的提升。它帮助我们淡化了传统协作下的分工和角色边界。非研发同学看代码原来成本很高,市场同学看产品策略设计也有理解成本,但现在都可以被 AI 消解掉。但不代表我们要给内部的 AI 再定一个分工,非得给它强行起个名词,叫 PMO 还是叫什么,我们觉得没有意义。


Founder Park:作为连续创业者,这次创业跟过往有什么不同?


郭列:对用户需求的洞察肯定还是有用的,但现在还需要对 Agent 有更多洞察。团队专注于事情和产品的氛围需要延续。


从 3G 到 5G,从文字图片到视频,移动互联网走了很长的过程。在 AI 时代,我们对整个技术会更有耐心,相信它最终会变得更便宜、更普适、效果更好,以这样的角度去跨越一些周期来做产品。短期波动比较正常,相信长期会有最终的变化。


但技术范式、付费方式、协作方式,这些完全不一样。大部分还是一个全新的创业经历。例如产品设计上,有些可以用工程方法解决,但那样就会把 AI 的发挥空间限制到很小,变得很死。这也需要有产品设计观念的转变。你给了 Agent 很大的自由度,就不能按传统方式去限制它。我们在做 Agent 的时候,还是要发挥 AI 的上限。


Founder Park:如果类比移动互联网,你觉得今天的 AI 产品处在哪一年?


郭列:应该是移动互联网的 10 到 11 年,就是 iPhone 发布之后的三年。AI 也就是 ChatGPT 发布之后的三年,还是属于非常早期的阶段。


Founder Park:今年会焦虑吗?


郭列:不是很焦虑,整体还是很看好这个行业。AI 还属于非常早期的阶段,每天接触新东西,可以学到很多,还是挺开心的。


创业风险还是蛮高的。即使不是 AI 创业,是传统互联网的创业,你做第二次、第三次创业,也都有失败的风险。更多还是对团队和行业有信心,这个团队迟早会做出用户喜欢和需要的产品。


对视频这个行业也有信心,用户在抖音或者其他地方,看到的 AI 视频越来越多,需求量肯定是增加的,迟早会有产品满足这样的需求。可能不一定是现在这个形态,但即使是新的形态,我们也能做出满足那个需求的产品。


但核心还是对团队有信心,这可能是第一次创业的经历带来的。好的团队在好的行业里面,迟早会做出一些东西。像 Manus 这样的团队,最开始做浏览器插件,到现在做 Manus,也是一个非常优秀的团队。


Founder Park:给今天做 AI 创业、Agent 创业的人一个建议?


郭列:整体还是要看好这个行业、相信这个行业。模型和 token 会越来越便宜,这个事情会越来越普适,迟早会到一个应用百花齐放的状态。现在整个 AI 还不是很普适,还处于一个非常早期的状态。


Founder Park:翻译一下:终局肯定是好的,现阶段要做的,是先保证自己一直留在牌桌上。


郭列:是的。


文章来自于微信公众号 “Founder Park”,作者 “Founder Park”

AI转型,免费服务,就找AITNT
AITNT资源拓展
根据文章内容,系统为您匹配了更有价值的资源信息。内容由AI生成,仅供参考
1
OWL

【开源免费】OWL是一个完全开源免费的通用智能体项目。它可以远程开Ubuntu容器、自动挂载数据、做规划、执行任务,堪称「云端超级打工人」而且做到了开源界GAIA性能天花板,达到了57.7%,超越Huggingface 提出的Open Deep Research 55.15%的表现。

项目地址:GitHub:https://github.com/camel-ai/owl

2
OpenManus

【开源免费】OpenManus 目前支持在你的电脑上完成很多任务,包括网页浏览,文件操作,写代码等。OpenManus 使用了传统的 ReAct 的模式,这样的优势是基于当前的状态进行决策,上下文和记忆方便管理,无需单独处理。需要注意,Manus 有使用 Plan 进行规划。

项目地址:https://github.com/mannaandpoem/OpenManus


3
AI工作流

【开源免费】字节工作流产品扣子两大核心业务:Coze Studio(扣子开发平台)和 Coze Loop(扣子罗盘)全面开源,而且采用的是 Apache 2.0 许可证,支持商用!

项目地址:https://github.com/coze-dev/coze-studio


【开源免费】n8n是一个可以自定义工作流的AI项目,它提供了200个工作节点来帮助用户实现工作流的编排。

项目地址:https://github.com/n8n-io/n8n

在线使用:https://n8n.io/(付费


【开源免费】DB-GPT是一个AI原生数据应用开发框架,它提供开发多模型管理(SMMF)、Text2SQL效果优化、RAG框架以及优化、Multi-Agents框架协作、AWEL(智能体工作流编排)等多种技术能力,让围绕数据库构建大模型应用更简单、更方便。

项目地址:https://github.com/eosphoros-ai/DB-GPT?tab=readme-ov-file



【开源免费】VectorVein是一个不需要任何编程基础,任何人都能用的AI工作流编辑工具。你可以将复杂的工作分解成多个步骤,并通过VectorVein固定并让AI依次完成。VectorVein是字节coze的平替产品。

项目地址:https://github.com/AndersonBY/vector-vein?tab=readme-ov-file

在线使用:https://vectorvein.ai/付费

4
智能体

【开源免费】AutoGPT是一个允许用户创建和运行智能体的(AI Agents)项目。用户创建的智能体能够自动执行各种任务,从而让AI有步骤的去解决实际问题。

项目地址:https://github.com/Significant-Gravitas/AutoGPT


【开源免费】MetaGPT是一个“软件开发公司”的智能体项目,只需要输入一句话的老板需求,MetaGPT即可输出用户故事 / 竞品分析 / 需求 / 数据结构 / APIs / 文件等软件开发的相关内容。MetaGPT内置了各种AI角色,包括产品经理 / 架构师 / 项目经理 / 工程师,MetaGPT提供了一个精心调配的软件公司研发全过程的SOP。

项目地址:https://github.com/geekan/MetaGPT/blob/main/docs/README_CN.md

5
prompt

【开源免费】LangGPT 是一个通过结构化和模板化的方法,编写高质量的AI提示词的开源项目。它可以让任何非专业的用户轻松创建高水平的提示词,进而高质量的帮助用户通过AI解决问题。

项目地址:https://github.com/langgptai/LangGPT/blob/main/README_zh.md

在线使用:https://kimi.moonshot.cn/kimiplus/conpg00t7lagbbsfqkq0