ByteNoteByteNote

字节笔记本

2026年9月1日

LocalAI:4.9 万星自托管 AI 引擎,任意硬件跑任意模型,API 直接兼容 OpenAI

API中转
¥120

本文介绍 mudler 开源的 LocalAI(4.9 万 stars,MIT)——自托管 AI 引擎:在任意硬件上跑任意模型(LLM、视觉、语音、图像、视频),不强制 GPU,并且对 OpenAI、Anthropic、ElevenLabs 的 API 直接兼容——现有代码改个 base URL 就能切到本地。

项目简介

LocalAI 用 Go 编写,是"本地跑 OpenAI 兼容 API"这个赛道的元老级项目。它的新版本架构理念很清晰:小核心,不捆绑——核心只做调度和 API 兼容层,每个模型后端(llama.cpp、vLLM、whisper.cpp、stable-diffusion、MLX 等)各自打包成独立镜像,模型用到哪个才拉哪个,不用的东西一个字节都不装。

核心特性

  • Drop-in API 兼容:OpenAI / Anthropic / ElevenLabs 三套 API 全后端通用,客户端零改动迁移
  • 全模态一个 API:文本、视觉、语音(TTS/STT)、图像生成、视频都在同一套接口后面
  • 任意硬件:NVIDIA、AMD、Intel、Apple Silicon、Vulkan,或者纯 CPU
  • 可组合后端:按需拉取独立镜像;开放后端接口,任何语言都能写自己的后端
  • 多用户就绪:API key 认证、用户配额、基于角色的访问控制——不只是个人玩具
  • 内置 AI agent:自带带工具调用的自主 agent、RAG 和技能体系
  • 隐私优先:数据不出你自己的基础设施

快速开始

Docker 一行(CPU 也能跑):

bash
docker run -ti --name local-ai -p 8080:8080 localai/localai:latest

NVIDIA GPU 换 localai/localai:latest-gpu-nvidia-cuda-12(或 cuda-13)镜像并加 --gpus all。macOS 有 DMG(未签名,装后需 sudo xattr -d com.apple.quarantine /Applications/LocalAI.app)。

服务起来后,把 OpenAI SDK 的 base_url 指向 http://localhost:8080/v1 即可开始对话。

适用场景

  • 企业内网 AI 网关:多用户、配额、权限一套齐,数据不出内网
  • 想统一 LLM/语音/图像接口的后端:不用为每个模态各接一个服务
  • 本地开发:写 OpenAI 兼容代码不烧线上 token

注意事项

  • CPU 推理可用但速度受限,生产负载建议至少一块消费级 GPU
  • 后端镜像按需拉取,首次启动某类模型会多一次下载等待
  • 版本迭代快,升级大版本前看 release notes 的 breaking changes

项目链接

分享: