《Tronlong 创龙 RK3588(TL3588-EVM / SBC-TL3588)大模型完整部署指南》

📅 发布时间:2026/7/31 6:55:16
《Tronlong 创龙 RK3588(TL3588-EVM / SBC-TL3588)大模型完整部署指南》 Tronlong 创龙 RK3588TL3588-EVM / SBC-TL3588大模型完整部署指南创龙TL3588平台RK3588/RK3588J6TOPS NPU优先使用瑞芯微官方RKLLM方案NPU硬件加速其次llama.cpp纯CPU、OllamaARM CPU无法调用NPU。⚠️ 重要前提创龙原厂固件必须升级RKNPU内核驱动 ≥0.9.8低于0.9.8无法正常运行RKLLM大模型。一、三种部署方案横向对比选型参考方案加速硬件优点缺点适用场景RKLLMrknn-llm✅ NPU加速官方原生、速度最快、功耗低支持W8A8/W4A16量化提供C API适合嵌入式二次开发需要PC端预先转换.rkllm模型版本严格匹配工业嵌入式、边缘产品、需要稳定NPU推理【首选】llama.cpp❌ CPU only直接加载GGUF无需模型转换快速调试推理速度慢、CPU占用高、发热大快速验证、临时测试Ollama❌ CPU only开箱即用、兼容OpenAI接口无法调用RK3588 NPU性能最差原型调试不建议产品落地创龙官方提供的LLM Demo全部基于RKLLM SDK下文以工业落地首选方案展开。二、硬件内存选型建议创龙TL3588RK3588内存决定可运行模型规模4GB DDRTL3588基础版推荐1.5B~3B量化模型DeepSeek-R1 1.5B、Qwen2.5-3B W8A8不建议尝试7B极易OOM内存溢出8GB/16GB DDRTL3588高配/SBC-TL3588推荐3B稳定运行7B W8A8可跑3~4 token/s实测参考创龙SBC-TL3588 16GBQwen2.5-3B W8A8≈9~12 token/sDeepSeek-R1 1.5B W8A8≈10~14 token/sQwen2.5-7B W8A8≈3.2~3.8 token/s三、步骤1创龙RK3588开发板系统环境准备3.1 固件烧录关键版本匹配下载创龙最新Ubuntu22.04固件Linux5.10不要使用老旧出厂镜像创龙资源平台https://www.tronlong.com烧写工具RKDevTool按住Recover通电进入烧录模式烧录完成上电验证NPU驱动版本# 查询RKNPU驱动版本必须≥0.9.8cat/sys/kernel/debug/rknpu/version如果版本0.9.8两种方案① 直接下载创龙更新后的完整固件最简单推荐② 手动内核源码替换rknpu驱动重新编译不推荐新手3.2 板端系统依赖安装Ubuntu22.04 aarch64sudoaptupdatesudoaptinstallgitcmake gcc g libssl-dev libopenblas-dev3.3 获取RKLLM Runtime库板端推理库瑞芯微官方仓库https://github.com/airockchip/rknn-llmgitclone https://github.com/airockchip/rknn-llm.gitcdrknn-llm# 拷贝aarch64运行时库到系统库目录sudocprkllm-runtime/Linux/librkllm_api/aarch64/librkllmrt.so /usr/lib/sudoldconfig四、步骤2PC端模型转换Ubuntu x86_64模型量化导出.rkllm转换主机建议内存≥32G转换7B模型建议40G以上内存否则容易OOM。4.1 PC端搭建RKLLM-Toolkit环境# 创建conda环境conda create-nrkllmpython3.10conda activate rkllm# 安装RKLLM toolkitpipinstallrkllm-toolkit4.2 转换脚本示例HuggingFace模型 → RKLLM W8A8新建export_llm.pyfromrkllm.apiimportRKLLM# 原始HF模型路径本地下载Qwen2.5-3B-Instructmodel_dir/path/to/Qwen2.5-3B-InstructllmRKLLM()# 加载模型retllm.load_huggingface(model_dirmodel_dir)ifret!0:raiseException(模型加载失败)# 模型量化配置rkllm_paramsRKLLM.RKLLMParam()rkllm_params.quant_typeRKLLM.RKLLMQuantType.RKLLM_W8A8# 8bit量化rkllm_params.target_platformRKLLM.RKLLMTargetPlatform.RK3588# 构建模型retllm.build(rkllm_params)ifret!0:raiseException(模型Build失败)# 导出rkllm文件llm.export_rkllm(./Qwen2.5-3B-Instruct-W8A8-RK3588.rkllm)print(模型导出完成)执行转换python export_llm.py可选量化RKLLM_W4A164bit模型体积更小精度略有损失。预转换模型捷径可以直接下载社区预转换好的rkllm模型免去PC转换HuggingFace搜索关键词rkllm RK3588 Qwen2.5 DeepSeek-R1五、步骤3创龙TL3588开发板运行大模型5.1 文件传输将生成的xxx.rkllm模型文件传到开发板使用rknn-llm自带示例demo或者创龙提供的llm_demo。5.2 命令行快速测试官方C Demo# 设置日志等级输出推理速度exportRKLLM_LOG_LEVEL1# 参数./llm_demo 模型路径 max_new_tokens context_window./llm_demo ./Qwen2.5-3B-Instruct-W8A8-RK3588.rkllm20484096启动后即可交互式对话日志打印Prefill/Generate token速度。5.3 C/C二次开发极简框架创龙产品开发使用#includerkllm_api.h// 推理回调函数voidcallback(RKLLMResult*result,void*userdata){printf(%s,result-text);}intmain(){RKLLMHandle llm_handle;RKLLMParam paramrkllm_create_default_param();param.model_path./model.rkllm;param.max_ctx_len4096;rkllm_init(llm_handle,param,callback);// 发起对话rkllm_run(llm_handle,你好请介绍创龙RK3588开发板,NULL);rkllm_wait_finish(llm_handle);rkllm_release(llm_handle);return0;}创龙TL3588配套SDK提供交叉编译环境可直接编译部署到板卡。六、部署Web服务OpenAI兼容API可选推荐rkllama封装RKLLM提供兼容OpenAI / Ollama REST接口Githubhttps://github.com/notpunchnox/rkllama# 开发板编译启动服务./rkllama server--model./Qwen2.5-3B.rkllm# 局域网其他设备调用curlhttp://192.168.1.100:8080/v1/chat/completions...七、高频踩坑清单创龙RK3588专属NPU驱动版本不匹配报错模型加载失败、segment fault。✅ 解决升级固件保证rknpu ≥0.9.8RKLLM Runtime版本必须与转换工具版本严格一致。4GB内存运行7B模型OOM✅ 限制4GB板优先1.5B/3B关闭桌面图形界面释放内存sudo systemctl stop lightdm模型转换成功板子load模型失败✅ 确认转换时target_platform RK3588不要选错RK3576量化格式W8A8/W4A16不要混用。推理速度忽快忽慢✅ 开启CPU调频性能模式sudoechoperformance/sys/devices/system/cpu/cpu0/cpufreq/scaling_governorsudoechoperformance/sys/devices/system/cpu/cpu4/cpufreq/scaling_governor创龙RT-Linux实时系统RKLLM可以运行但需要内核开启IOMMU实时系统下建议限制NPU任务优先级防止抢占实时任务。八、备选方案llama.cpp纯CPU无需模型转换如果你只是快速测试不想做RKLLM模型转换gitclone https://github.com/ggerganov/llama.cppcdllama.cppmake# 运行GGUF量化模型./main-mqwen2.5-3b.Q4_K_M.gguf-n512⚠️ 警告无法调用NPU速度远低于RKLLM方案不适合量产项目。九、工程落地建议工业场景-Tronlong TL3588量产硬件选型优先8GB DDR以上TL3588/SBC-TL3588模型选型工业问答、指令场景优先DeepSeek-R1-Distill 1.5B / Qwen2.5-3B W8A8系统使用创龙Ubuntu22.04如需实时控制区分AI推理进程与实时控制进程封装基于RKLLM C API开发守护进程提供本地TCP/HTTP接口方便上位机交互如果你需要我可以提供1可直接编译的完整RKLLM聊天服务源码2适配创龙TL3588的交叉编译CMake脚本3Qwen2.5-3B完整转换脚本参数调优模板4带前端WebUI的RK3588边缘大模型整套工程包。