
凌晨2点,一个B站直播里还有两百多人,同时在看一个人反复让DeepSeek跑任务。
屏幕上没什么特别的。
一个终端,一个Agent,一段不断往下刷的思维链。
弹幕却一直没停。
有人让他换一个Prompt,有人说重新开Session,有人怀疑刚才的请求被路由到了另一个版本,还有人已经在自己的电脑上复现刚才的结果。
这天是DeepSeek V4 Pro正式版和Harness发布的日子。
模型能力、不同版本、Harness效果,讨论还很混乱。
很多事情没有官方答案,连大家测到的是不是同一个东西,都说不清楚。
两百多人就在直播间里陪着他,一遍一遍地跑。
这个场景让我对B站有了一点新的认识。
在此之前,我基本没把它当成一个AI技术社区。
评论区居然开始研究模型指纹
我平时也看B站,只是看的东西跟AI没有太大关系。
鬼畜、军事,有时候首页推来一个几十分钟的视频,也会莫名其妙看完。
如果真要追一个刚发布的模型,我过去的习惯很固定:先看X,再去GitHub、Hugging Face,然后翻国内几个开发者社区和群。
B站通常排不到前面。
我对它的理解更接近一个内容(鬼畜)平台。
事情已经发生有一段时间后,有人研究明白了,再做成视频讲一遍。
最近一直在追DeepSeek V4,我才发现这个理解已经有点过时了。
我回头看了一下自己看到的DeepSeek有关内容。
V4 Pro不同版本的性能差异,社区后来讨论的几个不同模式,包括灰测的版本线索,再到Harness发布以后模型表现发生的变化。
我惊讶的发现,其中不少最早的线索,我居然都是在B站看到的。
不是有人把X上的帖子翻译搬运回来,是真的有人在测。
V4 Pro刚出来时,有一段时间社区非常混乱。
同样是DeepSeek V4 Pro,不同人拿到的结果差异很大。
有人觉得它已经强得很离谱,也有人觉得和之前相比没什么变化。
慢慢地,社区开始怀疑后端是不是存在多个版本,或者不同请求被路由到了不同模式。
我后来写过一次「三个模式」的讨论。
其中不少线索来自隔山水樵的视频和评论区。
评论区有人质疑他的测试环境:是不是Max模式?Key是什么时候开的?有没有可能碰到灰度测试或者不同路由?
他的回应不是简单说「我确定没有」。
他把Key创建时间、测试模式和自己的判断依据都放了出来。

讨论到后面有人开始观察模型的思维链。
发现这个版本经常说 users want me,另一个版本更常出现 let me。
一些人开始把这些细微的语言习惯当成模型指纹,再拿自己的Key去交叉测试。
有人提出猜测,有人立刻反驳;有人贴截图,有人重新跑。
很多结论后来未必都成立。
但这件事本身很有意思。一个视频网站的评论区,正在进行一种很民间的模型逆向研究。没有标准实验设计,没有论文,也没有人提前知道正确答案。
大家只是发现「这个东西好像不对」,然后开始往下挖。

DeepSeek Harness发布以后,我又看到了类似的事情。
小明XBright注意到,Harness的Minimal模式有一个反直觉的地方:工具明显更少,实际任务表现却可能比Standard更好。如果只是做模型测评,到这里已经足够了。
放两张跑分,再得出「少即是多」的结论,一条内容就完成了。
但他继续往下拆。
他在Windows环境中,用标准工具尝试还原Minimal模式的工作方式,想弄清楚真正影响模型表现的到底是什么。
工具数量、System Prompt、Context组织方式,还是Harness本身改变了模型解决问题的路径?
到了这里,它已经不太像一个传统意义上的「AI视频」。更像一份公开的实验记录。
新模型发布后,先开一场直播
后来我发现,这种内容在B站并不少。尤其是在新模型发布的头几天。
这是B站和X、GitHub很不一样的地方。X擅长快速传播一个结论。一个模型发布,Benchmark截图、体验判断、成功Case会在几个小时内铺开。GitHub则更适合代码最终沉淀下来。B站保留的是另一种东西:过程。
新模型上线几个小时,就有人开直播。主播先准备几个Case,观众在弹幕里继续出题。一个任务跑得特别好,大家会研究它为什么成功;跑崩了,就开始往前翻,看问题到底出在第几步。有人怀疑Prompt,就换Prompt。有人怀疑Context,就开一个新Session。有人觉得模型被路由了,就换Key再跑。
直播间里甚至没有明确的「主播」和「观众」分工。很多时候,观众也在自己的电脑上跑。一个人在直播间里发现异常,几十个人同时开始复现。几个小时以后,其中一个人把结果整理成视频;第二天,评论区又多了一轮讨论。再过一天,可能已经有人把解决方案写成了代码。

这是一种很奇怪的技术社区形态。十几年前,这些事情可能发生在论坛里。一个人发帖说自己发现了一个Bug,下面几十层回复一起排查。现在帖子变成了视频,回复变成了弹幕。连实验本身也变成实时的了。
模型刚发布,研究已经开始。
从测模型,到自己做东西
B站自己披露的数据,其实也能解释这种变化为什么会发生。
它早就不只是少数程序员偶尔发技术视频的地方。
AI已经成为平台增长很快的一类内容,观看模型测评、编程、Agent和各种AI应用的人越来越多。
过去内容创作者和开发者往往是两个角色。
一个人做项目,另一个人负责把它讲出来。现在越来越多时候,这两件事是同一个人在做。
最近DeepSeek Harness的插件生态里,就出现了两个挺典型的例子。
8月13日晚的DSH插件热榜快照中,colleague-skill排在第1。
它的作者@只是路过的titanwings,是一名B站UP主。

这个项目解决的问题很具体:怎么把同事脑子里的工作经验变成Agent能够直接调用的Skill。
公司里真正有价值的知识,很多时候并没有被写进知识库。
它可能只是一个销售做了几年以后知道,面对某类客户应该先问哪几个问题;也可能是一个运营看到一组异常数据时,下意识知道第一步应该检查哪里。
这些经验很难被传统知识库捕捉。
colleague-skill尝试把它们结构化,让Agent能够复用人的工作经验,并完成了DeepSeek Harness的适配。
同一晚的热榜快照里,第3名OpenBiliClaw的作者littlewish,同样是一名B站UP主。它做的事情甚至和B站本身有关:让Agent连接和使用B站内容。

我们通常说让Agent连接互联网,想到的是Google、网页搜索和浏览器。但中文互联网有大量有价值的信息并不以一篇结构清晰的网页存在。
它可能是一段视频,也可能在评论区,或者分散在一个创作者过去几个月的内容里。OpenBiliClaw尝试让Agent进入这些内容场景。
项目随后也在GitHub开源,开发者可以继续通过Star、Fork和Issue参与。
它们提供了一个有意思的切面。
B站上的AI内容,正在形成一条以前不太常见的链路:先有人讨论一个问题。
有人开始测试。围观的人参与复现。开发者发现真实需求。
最后做成Skill、插件或者产品,再开源到GitHub。
内容、社区和开发之间的边界变得越来越模糊。
B站在这条链路里承担的,也不只是「传播」的角色。
它开始成为一些开发者找到第一批用户、获得反馈,甚至寻找合作者的地方。
AI需要的,可能刚好就是这种社区
这也是我最近对B站改观最大的地方。
过去我们很容易想象,真正前沿的AI工作应该发生在几个固定的地方。
研究在实验室、代码在GitHub、消息在微信里。
国内开发者再建立几个自己的论坛和群。
但AI,尤其是大模型,改变了一部分技术社区的组织方式。
模型的门槛和传统软件不太一样。
一个刚发布的模型,任何人都可以立刻开始测试。
它的很多能力也没办法只靠一张Benchmark表格理解。
同一道题跑两次,结果可能不同;
Prompt改一点,结果可能不同;
Context、工具甚至Harness换掉,模型都会表现得像另一个东西。
于是「一起玩」本身开始变得有价值。

而视频、直播、弹幕,刚好很适合这件事。
它没有GitHub那么严谨,也没有论文那么可靠。
错误很多,猜测更多。
有人今天信誓旦旦发现了新版本,明天可能发现只是自己的测试条件出了问题。
但技术社区真正活跃的时候,本来就不是所有人都在等待最终答案。
总得有人先试。有人先猜错。
有人说「你这个不对」,然后另一群人再跑一次。
X把结论传出去,GitHub把代码留下来。
B站把实验留在了还没结束的那几个小时里。
对大模型这种高度路径依赖、又很难一次测准的东西,这几个小时可能比结论更重要。
所以现在DeepSeek再更新,我依然会打开X,翻GitHub,也会看几个熟悉的技术社区。只是多了一个以前不会有的动作:去B站搜一下。
我的首页还是很混乱。上一条可能是鬼畜。
下一条是军事。划两下,有人在直播拆DeepSeek Harness。
但现在我不觉得这几件事情放在一起很奇怪了。
B站没有在哪一天突然宣布自己要成为一个AI技术社区。
它甚至可能从来没有认真设计过这件事。
只是在这一轮AI浪潮里,一群本来就喜欢折腾东西的人,开始在这里测试模型、讨论问题、写代码,也找到和自己一样的人。
等我追DeepSeek V4的时候注意到他们,这个社区已经在那里了。
而且比我想象中热闹得多。
感谢您的观看🥹
我是Max,一个在AI方向持续探索的小学生。
我会持续更新一些AI方向最新最快的产品,技术,思考
文章来自于微信公众号 “01Founder”,作者 “01Founder”
【开源免费】DeepBI是一款AI原生的数据分析平台。DeepBI充分利用大语言模型的能力来探索、查询、可视化和共享来自任何数据源的数据。用户可以使用DeepBI洞察数据并做出数据驱动的决策。
项目地址:https://github.com/DeepInsight-AI/DeepBI?tab=readme-ov-file
本地安装:https://www.deepbi.com/
【开源免费】airda(Air Data Agent)是面向数据分析的AI智能体,能够理解数据开发和数据分析需求、根据用户需要让数据可视化。
项目地址:https://github.com/hitsz-ids/airda
【开源免费】AutoGPT是一个允许用户创建和运行智能体的(AI Agents)项目。用户创建的智能体能够自动执行各种任务,从而让AI有步骤的去解决实际问题。
项目地址:https://github.com/Significant-Gravitas/AutoGPT
【开源免费】MetaGPT是一个“软件开发公司”的智能体项目,只需要输入一句话的老板需求,MetaGPT即可输出用户故事 / 竞品分析 / 需求 / 数据结构 / APIs / 文件等软件开发的相关内容。MetaGPT内置了各种AI角色,包括产品经理 / 架构师 / 项目经理 / 工程师,MetaGPT提供了一个精心调配的软件公司研发全过程的SOP。
项目地址:https://github.com/geekan/MetaGPT/blob/main/docs/README_CN.md
【开源免费】FASTGPT是基于LLM的知识库开源项目,提供开箱即用的数据处理、模型调用等能力。整体功能和“Dify”“RAGFlow”项目类似。很多接入微信,飞书的AI项目都基于该项目二次开发。
项目地址:https://github.com/labring/FastGPT
【开源免费】LangGPT 是一个通过结构化和模板化的方法,编写高质量的AI提示词的开源项目。它可以让任何非专业的用户轻松创建高水平的提示词,进而高质量的帮助用户通过AI解决问题。
项目地址:https://github.com/langgptai/LangGPT/blob/main/README_zh.md
在线使用:https://kimi.moonshot.cn/kimiplus/conpg00t7lagbbsfqkq0
【开源免费】VideoChat是一个开源数字人实时对话,该项目支持支持语音输入和实时对话,数字人形象可自定义等功能,首次对话延迟低至3s。
项目地址:https://github.com/Henry-23/VideoChat
在线体验:https://www.modelscope.cn/studios/AI-ModelScope/video_chat
【开源免费】Streamer-Sales 销冠是一个AI直播卖货大模型。该模型具备AI生成直播文案,生成数字人形象进行直播,并通过RAG技术对现有数据进行寻找后实时回答用户问题等AI直播卖货的所有功能。
项目地址:https://github.com/PeterH0323/Streamer-Sales