字
字节笔记本
2026年9月1日
LocalAI:4.9 万星自托管 AI 引擎,任意硬件跑任意模型,API 直接兼容 OpenAI
API中转
¥120
本文介绍 mudler 开源的 LocalAI(4.9 万 stars,MIT)——自托管 AI 引擎:在任意硬件上跑任意模型(LLM、视觉、语音、图像、视频),不强制 GPU,并且对 OpenAI、Anthropic、ElevenLabs 的 API 直接兼容——现有代码改个 base URL 就能切到本地。
项目简介
LocalAI 用 Go 编写,是"本地跑 OpenAI 兼容 API"这个赛道的元老级项目。它的新版本架构理念很清晰:小核心,不捆绑——核心只做调度和 API 兼容层,每个模型后端(llama.cpp、vLLM、whisper.cpp、stable-diffusion、MLX 等)各自打包成独立镜像,模型用到哪个才拉哪个,不用的东西一个字节都不装。
核心特性
- Drop-in API 兼容:OpenAI / Anthropic / ElevenLabs 三套 API 全后端通用,客户端零改动迁移
- 全模态一个 API:文本、视觉、语音(TTS/STT)、图像生成、视频都在同一套接口后面
- 任意硬件:NVIDIA、AMD、Intel、Apple Silicon、Vulkan,或者纯 CPU
- 可组合后端:按需拉取独立镜像;开放后端接口,任何语言都能写自己的后端
- 多用户就绪:API key 认证、用户配额、基于角色的访问控制——不只是个人玩具
- 内置 AI agent:自带带工具调用的自主 agent、RAG 和技能体系
- 隐私优先:数据不出你自己的基础设施
快速开始
Docker 一行(CPU 也能跑):
bash
docker run -ti --name local-ai -p 8080:8080 localai/localai:latestNVIDIA GPU 换 localai/localai:latest-gpu-nvidia-cuda-12(或 cuda-13)镜像并加 --gpus all。macOS 有 DMG(未签名,装后需 sudo xattr -d com.apple.quarantine /Applications/LocalAI.app)。
服务起来后,把 OpenAI SDK 的 base_url 指向 http://localhost:8080/v1 即可开始对话。
适用场景
- 企业内网 AI 网关:多用户、配额、权限一套齐,数据不出内网
- 想统一 LLM/语音/图像接口的后端:不用为每个模态各接一个服务
- 本地开发:写 OpenAI 兼容代码不烧线上 token
注意事项
- CPU 推理可用但速度受限,生产负载建议至少一块消费级 GPU
- 后端镜像按需拉取,首次启动某类模型会多一次下载等待
- 版本迭代快,升级大版本前看 release notes 的 breaking changes
项目链接
- GitHub 仓库:https://github.com/mudler/LocalAI
- 官方文档:https://localai.io/
- 模型库:https://models.localai.io/
分享: