刚刚,蚂蚁百灵大模型开源轻量级混合推理MoE模型——Ling-3.0-tiny。
刚刚,蚂蚁百灵大模型开源轻量级混合推理MoE模型——Ling-3.0-tiny。今日,蚂蚁百灵大模型开源了一款轻量级混合推理MoE模型——Ling-3.0-tiny。该模型总参数量为7.9B,推理时激活参数量为1.3B,主要面向高效本地部署而设计。其同步提供BF16、FP8和INT4三个版本,已在DGX Spark、MacBook、Mac mini等设备上完成验证,兼顾性能、效率与可部署性。
搜索
今日,蚂蚁百灵大模型开源了一款轻量级混合推理MoE模型——Ling-3.0-tiny。该模型总参数量为7.9B,推理时激活参数量为1.3B,主要面向高效本地部署而设计。其同步提供BF16、FP8和INT4三个版本,已在DGX Spark、MacBook、Mac mini等设备上完成验证,兼顾性能、效率与可部署性。
当下计算机视觉长期陷入“一任务一专用模型”内卷: 做深度估计要用DepthAnything,分割依赖SAM,人体姿态单独训练Sapiens,几何重建还得搭VGGT,各类网络骨干、解码器、损失函数完全割裂,研发与部署成本居高不下。
AI替代人的同时,也在创造新工作。FDE(前沿部署工程师),成为今年最火的AI新岗位。这个职位的任务是驻场在客户现场,解决AI落地的问题。那些靠帮企业落地大模型赚钱的公司,已经把它做成了业务标配。
一块 8.24GB 内存的 CPU,一个 2.78 万亿参数的大模型,甚至不需要显卡,Kimi K3 就这么水灵灵地跑起来了。
Glow 是一家由前Meta和Snowflake高管创立的网络安全初创公司,它在结束隐身状态时便已跻身独角兽行列,押注于人工智能正在重塑企业保护员工设备的方式。随着越来越多企业部署AI工具,攻击者也越来越多地利用生成式AI自动化钓鱼攻击、开发恶意软件、发起更复杂的网络攻击,各公司正在重新思考如何保护端点安全,从员工笔记本电脑到服务器及其他联网设备。
她是xAI前推理团队负责人。她研究并发起的开源推理引擎SGLang,已经成为众多大模型部署和推理的重要底层工具,也是目前AI infra领域最具影响力的开源推理框架之一。如今,她从SGLang开源生态中孵化出创业公司RadixArk,希望把只有少数科技巨头才能拥有的前沿AI基础设施,变成整个行业都可以使用的开放技术底座。
刚刚,SpaceX 宣布正与英伟达达成合作,共同设计 Starmind AI1 卫星计算载荷。每颗 Starmind 卫星都将搭载 NVIDIA Rubin GPU 和 Vera CPU,把接近数据中心级别的算力部署到太空。
最近,Wafer AI 在 AMD MI355X 上部署了 Kimi K3。结果是,原本需要 16 张 NVIDIA B200、横跨两台服务器运行的模型,在一台配备 8 张 MI355X 的 AMD 服务器中就能完成部署。
企业采购Agent,正在变得越来越容易。
有人总结,运行 Kimi K3 其实很容易,只需要 1.5TB GPU 内存、大约 8 张 H100,以及一座小型变电站。一名开发者拿出一台 128GB 统一内存的 M5 Max,直接加载 Kimi K3 发布在 Hugging Face 上的官方 MXFP4 权重。