
Docker部署LocalAI跑通本地推理【免费下载链接】LocalAILocalAI is the open-source AI engine. Run any model - LLMs, vision, voice, image, video - on any hardware. No GPU required.项目地址: https://gitcode.com/GitHub_Trending/lo/LocalAI想本地部署大模型但环境配置总是让人头疼LocalAI 是一个开源的本地 AI 推理引擎提供与 OpenAI API 兼容的 REST 接口让你在没有 GPU 的消费级硬件上跑起文本、图像、语音等模型。项目速览OpenAI兼容的本地推理引擎LocalAI 是 OpenAI、Anthropic 等服务的直接替代品把现有客户端的地址指到自己的服务器代码不用改。架构上是小核心 可插拔后端llama.cpp、vLLM、whisper.cpp、stable-diffusion 等引擎各自独立成 OCI 镜像只有真正运行对应模型时才拉取不装用不上的东西。兼容 OpenAI、Anthropic、ElevenLabs 三套 API 规范现有客户端直接替换多模态文本生成、图像生成、语音合成/识别、embedding、视频后端可组合独立镜像按需拉取核心只占一个轻量二进制硬件不限NVIDIA、AMD、Intel、Apple Silicon 或纯 CPU内置 Web UI 和 CLI支持 API key 认证与多用户环境准备纯CPU跑通所需硬件与软件项目要求CPU 架构x86_64 或 ARM64Apple Silicon、Jetson 均可内存建议 8GB 起4B 级别量化模型 8GB 可运行GPU不需要NVIDIA / AMD / Intel / Vulkan 均可选加速操作系统Linux、macOS、WindowsWSL2软件Docker 或 podman可访问外网下载模型文件Docker部署启动LocalAI并加载第一个模型一条命令启动 CPU 镜像暴露 8080 端口docker run -ti --name local-ai -p 8080:8080 localai/localai:latest然后浏览器打开 http://localhost:8080 进入 Models → Explore安装qwen3-4b。这是个较小的 Qwen3 模型CPU 友好且支持工具调用下载需要几分钟。也可以启动时直接传入模型API 启动前会自动下载宿主有 GPU 时 LocalAI 会自动探测能力并拉取匹配的后端不用手动配置。不想用 Docker 的话可以从官方 release 页直接拿 CLI 二进制或源码构建方式见仓库根目录 Makefile 。验证与首次调用两条命令确认推理服务可用curl http://localhost:8080/readyz curl -s http://localhost:8080/v1/models/readyz返回 ok模型列表里能看到已安装的qwen3-4b就算装好了。如果要暴露到局域网启动时加LOCALAI_API_KEYyour-key做访问门禁API key 具备管理员权限裸奔暴露前先想清楚。实际任务一次chat completions调用最常用的端点是/v1/chat/completions把 SDK 的 base_url 指向http://localhost:8080/v1原有客户端无需改动curl http://localhost:8080/v1/chat/completions \ -H Content-Type: application/json \ -d {model:qwen3-4b,messages:[{role:user,content:用一句话介绍你自己}]}输入是模型名必须是已安装的加 messages 数组输出在choices[0].message.content是回复文本加stream: true逐 token 流式返回。同样的请求在 Web UI 的 Chat 页也可以完成踩坑记录本地模型部署的四个高频问题8080 端口被占用。把宿主端映射改成-p 9090:8080即可容器内仍是 8080只是访问地址变了。404 model not found。检查请求里的名字和/v1/models输出是否完全一致模型可能还在下载或根本没装。模型加载失败日志报后端错误。后端是按需拉取的对应引擎可能没装上用local-ai backends list检查已装列表再补装GGUF 模型依赖 llama-cpp 后端。CPU 推理慢或内存吃紧。换更小的量化版本如 q4_k_m降低并发请求数7B 以上模型在纯 CPU 上体感明显变慢入门建议选 1-4B 规格。进阶方向分布式推理与自定义后端单节点跑通后下一步是组集群。core/p2p/ 实现了 P2P 节点发现与联邦协调仓库根目录的 docker-compose.distributed.yaml 可以直接拉起多节点分布式推理。模型管理靠内置 gallerygallery/ 里每个 YAML 是一个预配置模型core/gallery/importers/ 处理 Huggingface、OCI registry 等来源的导入。后端也可以自己写backend/go/ 是按推理引擎组织的 Go 后端实现backend.proto 定义开放接口任意语言都能实现对接。工具调用与 MCP 相关看 pkg/functions/ LLM 工具调用输出解析和 core/services/mcp/ MCP 服务集成。配置细节更多后端兼容性表格在 docs/ 里都有遇到问题直接到社区提 Issue。【免费下载链接】LocalAILocalAI is the open-source AI engine. Run any model - LLMs, vision, voice, image, video - on any hardware. No GPU required.项目地址: https://gitcode.com/GitHub_Trending/lo/LocalAI创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考