Mac LLM 服务器,将智能体等待时间从 90 秒缩短至 5 秒
oMLX 是一款基于 Mac 的本地 LLM 推理服务器,可直接从菜单栏一键启动,将 Claude Code 和 Cursor 等智能体的响应时间从约 90 秒压缩至 5 秒。它使用 Swift 原生开发(非 Electron),支持文本、视觉、OCR、嵌入与重排序等多种模型的连续批处理,并配备可在重启后保留的 RAM+SSD 分层 KV 缓存,同时原生兼容 OpenAI 与 Anthropic 的 API。项目遵循 Apache 2.0 开源协议。




