只用一张卡,做出了声称是100M参数以内最好的小模型?

AITNT-国内领先的一站式人工智能新闻资讯网站
# 热门搜索 #
只用一张卡,做出了声称是100M参数以内最好的小模型?
8202点击    2026-08-02 13:45

AI 圈有一种颇为复古的快乐:小参数模型暴打远超自身体量的对手。


上周,一位名为 slvDev 的开发者将一个 2890 万参数的语言模型,装进了售价约 8 美元的 ESP32-S3 微控制器。整块板子只有 512KB SRAM、8MB PSRAM 和 16MB 闪存。无需联网,模型可以直接在芯片上以约 9.5 token/s 的速度生成文本。


当然,这个模型只在 TinyStories 上训练过。它不会写代码,不能调用工具,也回答不了世界知识问题,主要能力是续写简短的儿童故事。


但这似乎并不妨碍开发者们玩得很开心。


近日,独立开发者 Harshal Singh 公布了一个仅有 3500 万参数的基础语言模型 BarunLM,并声称:「我预训练了世界上参数量小于 100M 的最好模型」。


只用一张卡,做出了声称是100M参数以内最好的小模型?


按照作者给出的结果,BarunLM-35M 在九项零样本基准上的平均准确率达到 41.01%,超过了参数量约为其 6.55 倍的 Liquid AI LFM2.5-230M-Base,也超过了 GPT-2、Pythia-160M 等体量明显更大的模型


更惊人的是,该模型仅使用单个 H200 GPU 进行训练


整个项目已经开放模型权重、训练与推理代码以及完整评测结果,采用 Apache 2.0 许可证。


  • Github 链接:https://github.com/harrrshall/barunlm-35m
  • Huggingface 链接:https://huggingface.co/harrrshall/BarunLM-35M


技术细节:让大部分注意力「只看附近」


BarunLM-35M 共有 35,072,768 个参数,使用约 57 亿 token 进行预训练,训练上下文长度为 2048。


作者采用 LM Evaluation Harness 0.4.12,对模型进行了九项零样本评测,包括 ARC-Challenge、ARC-Easy、BoolQ、HellaSwag、LAMBADA、OpenBookQA、PIQA、SciQ 和 WinoGrande。


只用一张卡,做出了声称是100M参数以内最好的小模型?


在这套评测中,BarunLM 领先 LFM2.5-230M-Base 1.81 个百分点。作者还进行了 1 万次配对 bootstrap 重采样,得到的差值置信区间为 0.92 至 2.71 个百分点。


性能提升源于更优的架构。作者从 DeepSeek、Kimi 和其他前沿开源模型中汲取了灵感。


模型共有 12 层,隐藏层宽度为 448,采用 7 个查询头和 1 个共享键值头。其最显眼的设计,是按照 3∶1 的比例交替使用局部注意力与全局注意力:连续三个网络层只查看前后 256 个 token,第四层再执行一次全局信息交换。


标准全局注意力需要让序列中的每个 token 与其他所有 token 建立联系,计算量会随序列长度平方增长。但语言中的大量依赖其实发生在相邻范围内,因此,BarunLM 让大多数层处理局部信息,只定期打开一次全局视野。


这种设计降低了计算开销,同时又没有完全切断长距离信息流。


第二项关键设计是「可学习残差选择器」。模型每隔四层设置一次选择机制,在多个中间表示之间决定应该保留哪些信息。它试图解决小模型的一个现实难题:网络容量有限,每一层都很珍贵,如果早期形成的有效特征在后续计算中被覆盖,模型没有足够冗余去重新学习。


除此之外,BarunLM 还组合了分组查询注意力、50% Partial RoPE、QK Normalization、门控注意力输出和 bounded SwiGLU,并将输入、输出嵌入权重绑定。词表被控制在 16384,进一步减少了嵌入层占用的参数。


训练预算同样值得注意。模型共看过约 57 亿 token,相当于每个参数对应 162.5 个训练 token。数据来自 FineWeb-Edu、Cosmopedia v2、FineMath-4+、DCLM、CodeSearchNet Python 和 CodeParrot Clean,覆盖教育文本、合成数据、数学、通用网页与代码。


最后 40 亿 token 的训练在单张 H200 上完成,使用 Muon 优化器,共训练 40690 步。


BarunLM 首先是一个基础模型,没有经过指令微调。它的上下文窗口只有 2048。作者明确表示,它主要面向紧凑语言模型研究、教学、文本生成实验和本地原型开发,而非医疗、法律或金融等高风险场景。


小模型的意义,不是成为缩小版 ChatGPT。当一张卡的训练预算就能够实现一些强大性能的时候,未来的想象将更加广阔。


文章来自于微信公众号 “机器之心”,作者 “机器之心”

AI转型,免费服务,就找AITNT
AITNT资源拓展
根据文章内容,系统为您匹配了更有价值的资源信息。内容由AI生成,仅供参考
1
知识库

【开源免费】FASTGPT是基于LLM的知识库开源项目,提供开箱即用的数据处理、模型调用等能力。整体功能和“Dify”“RAGFlow”项目类似。很多接入微信,飞书的AI项目都基于该项目二次开发。

项目地址:https://github.com/labring/FastGPT

2
微调

【开源免费】XTuner 是一个高效、灵活、全能的轻量化大模型微调工具库。它帮助开发者提供一个简单易用的平台,可以对大语言模型(LLM)和多模态图文模型(VLM)进行预训练和轻量级微调。XTuner 支持多种微调算法,如 QLoRA、LoRA 和全量参数微调。

项目地址:https://github.com/InternLM/xtuner