NUC8 上使用 Ollama + Open WebUI 的轻量化本地大模型实践
背景与目标 在无 GPU、仅依赖 CPU 的环境中运行本地大模型,核心目标并不是追求参数规模,而是可长期运行、响应稳定、不干扰其他服务。本文记录了一套经过验证的实践方案:使用 Ollama 作为推理引擎,配合 Open WebUI 提供交互界面,并围绕模型体量、内存常驻、容器健康状态等关键点进行取舍与优化。 运行环境与约束条件 在该条件下,7B 级模型可以加载,但并不适合作为日常默认模型,会带来明显的加载延迟与系统压力。 模型选择策略(按体量与用途分层) 推荐的本地模型梯度 体量 模型示例 主要用途 评价 ~1.5B Qwen2.5 1.5B 兜底、系统繁忙时 极轻量,可长期常驻 ~2B Phi-3 Mini 默认工程模型 推理快、代码/脚本稳定 ~3B Qwen2.5 3B 中文/日语表达 语言自然度更好 ~7B Qwen2.5 7B 实验/对比 不建议常驻 结论:在 CPU-only 环境中,3B 以内是“甜点区间”,7B 更适合作为偶尔实验而非常驻。 部署架构概览 模型文件统一存放在持久化卷中,支持多模型并存,下载一次即可长期复用。 Docker Compose 配置(关键点) 在保持原有结构与注释的前提下,仅增加了模型内存常驻策略: …