NUC8 上使用 Ollama + Open WebUI 的轻量化本地大模型实践

背景与目标 在无 GPU、仅依赖 CPU 的环境中运行本地大模型,核心目标并不是追求参数规模,而是可长期运行、响应稳定、不干扰其他服务。本文记录了一套经过验证的实践方案:使用 Ollama 作为推理引擎,配合 Open WebUI 提供交互界面,并围绕模型体量、内存常驻、容器健康状态等关键点进行取舍与优化。 运行环境与约束条件 在该条件下,7B 级模型可以加载,但并不适合作为日常默认模型,会带来明显的加载延迟与系统压力。 模型选择策略(按体量与用途分层) 推荐的本地模型梯度 体量 模型示例 主要用途 评价 ~1.5B Qwen2.5 1.5B 兜底、系统繁忙时 极轻量,可长期常驻 ~2B Phi-3 Mini 默认工程模型 推理快、代码/脚本稳定 ~3B Qwen2.5 3B 中文/日语表达 语言自然度更好 ~7B Qwen2.5 7B 实验/对比 不建议常驻 结论:在 CPU-only 环境中,3B 以内是“甜点区间”,7B 更适合作为偶尔实验而非常驻。 部署架构概览 模型文件统一存放在持久化卷中,支持多模型并存,下载一次即可长期复用。 Docker Compose 配置(关键点) 在保持原有结构与注释的前提下,仅增加了模型内存常驻策略: …

在低功耗服务器上自托管 Qwen 7B 并通过公网安全访问

随着大模型能力的提升,将语言模型部署到本地服务器(self-hosted)已成为追求数据自治、隐私保护与长期可控性用户的一种现实选择。本文以 Qwen 7B 为例,记录了一种在中低配置服务器上,通过 Docker + Web UI + 公网反向代理 的方式,构建“类似 ChatGPT 的网页使用体验”的完整方案。全文不包含任何真实路径、端口或域名等敏感信息,仅保留通用架构与可复现的工程思路。 一、为什么选择本地部署 Qwen 7B 选择本地部署而非完全依赖云端模型,主要基于以下考虑: 需要明确的是,本地 7B 级模型并非用来“对标”云端超大模型,而是作为一个稳定、可控、随时可用的本地认知工具。 二、硬件与资源需求(现实可行范围) 本文方案基于一台低功耗小型服务器,而非专业 GPU 服务器。 推荐最低配置(CPU-only) 虚拟化场景下的资源分配 在虚拟化环境中(如 PVE / KVM): 该资源条件下,可长期运行: 三、整体架构设计(不暴露 AI 节点) 核心设计原则 逻辑拓扑(文字描述) 四、容器化部署思路(Docker) 组件拆分 两者均通过 Docker 容器运行,数据通过 volume 持久化。 设计要点 五、公网访问的安全策略 反向代理职责 反向代理服务器承担所有“对外风险”: 必须具备的安全措施 通过该方式,即使域名被扫描,攻击面也仅限于反代层。 六、实际使用体验与定位 …