如何用llama.cpp快速部署CodeShell大模型服务:新手5步从编译到启动完整教程

📅 发布时间:2026/8/28 10:16:40
如何用llama.cpp快速部署CodeShell大模型服务:新手5步从编译到启动完整教程 如何用llama.cpp快速部署CodeShell大模型服务新手5步从编译到启动完整教程【免费下载链接】codeshell-vscodeAn intelligent coding assistant plugin for Visual Studio Code, developed based on CodeShell项目地址: https://gitcode.com/gh_mirrors/co/codeshell-vscode用 llama.cpp 部署 CodeShell 大模型服务无需 GPU 即可让 Visual Studio Code 变身 AI 编程助手。CodeShell 智能编码助手插件支持代码补全、代码解释、代码优化与智能问答全程本地运行、隐私无忧。本文按编译 → 下载模型 → 启动服务 → 安装插件 → 配置验证5 个步骤手把手带你从零跑通整个流程。 本教程基于开源项目 README.md 的部署说明整理插件源码位于 src/extension.ts可放心对照阅读。第1步准备工作与编译llama.cpp模型服务开始之前请先确认环境满足以下要求依赖项版本要求Node.jsv18 及以上Visual Studio Code1.68.1 及以上CMake C 编译器任意主流版本编译 llama.cpp for CodeShell 项目该项目提供了 CodeShell 大模型的 4bits 量化推理引擎不同系统的操作如下Linux / MacApple Silicon克隆仓库后进入目录执行make即可。macOS 默认启用 Metal模型会加载到 GPU 上运行速度提升明显。Mac非 Apple Silicon编译时加参数LLAMA_NO_METAL1 make禁用 Metal避免运行时异常。Windows推荐使用 Windows Subsystem for LinuxWSL按 Linux 的方法编译即可。第2步下载CodeShell量化模型文件本教程使用 4bits 量化版模型codeshell-chat-q4_0.gguf来自 CodeShell-7B-Chat-int4 模型体积小、CPU 也能流畅推理请将其下载到项目的llama_cpp_for_codeshell/models目录下。第3步启动模型API服务在命令行中执行以下命令即可启动 CodeShell 模型服务./server -m ./models/codeshell-chat-q4_0.gguf --host 127.0.0.1 --port 8080参数说明-m指定模型文件路径--host/--port指定服务地址默认监听http://127.0.0.1:8080与插件的默认设置一致⚠️ 小提示macOS 上若编译时启用了 Metal 但运行出现异常可在命令行追加参数-ngl 0显式关闭 GPU 推理让模型回落到 CPU 运行。第4步编译并安装CodeShell VSCode插件进入 codeshell-vscode 项目目录执行以下命令从源码打包插件git clone https://link.gitcode.com/i/34aa41d21ef635884523a804edfaa458 cd codeshell-vscode npm install npm exec vsce package执行完成后会得到codeshell-vscode-${VERSION_NAME}.vsix文件。在 VSCode 扩展面板中执行Install from VSIX...命令选择该文件即可完成插件安装。第5步配置插件连接模型服务并验证打开 VSCode 设置Ctrl/Cmd ,搜索CodeShell重点配置以下两项Code Shell: Server Address填写http://127.0.0.1:8080与第3步启动的地址保持一致默认值即为此Code Shell: Run Env For LLMs选择CPU with llama.cpp此外还可以按需调整自动触发补全开关Auto Trigger Completion、自动触发延迟Auto Completion Delay1~3 秒、补全与问答的最大 tokens 数量。这些配置的读取逻辑可在 src/consts.ts 中查看。功能验证一AI代码补全开始编写代码停止输入约 1 秒后灰色建议就会出现在光标位置按Tab接受或继续输入忽略。也可以按快捷键Alt\Windows或Option\Mac手动触发补全请求由 src/request/inline-completion.ts 发送到你刚刚启动的 llama.cpp 服务。功能验证二代码解释、优化与安全检查在编辑器中选中一段代码右键选择CodeShell子菜单即可让模型执行解释这段代码、优化这段代码、清理这段代码、生成注释、生成单元测试、检查性能问题、检查安全问题等操作答案会显示在侧边栏问答界面中。功能验证三智能多轮问答点击活动栏的 CodeShell 图标打开问答面板支持多轮对话与会话历史回答中的代码块可一键复制或直接插入到编辑器光标处。常见问题速查现象原因与解决办法插件无响应、提示请求超时模型服务未启动先确认第3步的server进程正在运行macOS 编译后运行报 Metal 相关错误追加-ngl 0参数关闭 GPU 推理非 Apple Silicon 的 Mac 运行异常重新编译时加LLAMA_NO_METAL1补全建议过长/过短在插件设置中调整Completion Max Tokens64~1024 恭喜至此你已经用 llama.cpp 在本地跑通了 CodeShell 大模型服务并让 VSCode 拥有了代码补全、代码辅助与智能问答三大 AI 能力。更多功能细节可参考 src/extension.ts 与 README.md。【免费下载链接】codeshell-vscodeAn intelligent coding assistant plugin for Visual Studio Code, developed based on CodeShell项目地址: https://gitcode.com/gh_mirrors/co/codeshell-vscode创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考