N100 跑本地大模型够用吗?我折腾 7 天,拿 Qwen2.5-7B 和旧笔记本、3060、云 API 各测了一轮

🔑 关键词:N100本地大模型,Ollama教程,Qwen2.5部署,家庭NAS跑AI,Token速度

📖 摘要:别急着买 N100 迷你主机跑 7B。记录我用 N100、i5-8250U 旧笔记本、RTX 3060 12G 和云 API 做本地大模型对比,给出具体 token/s、功耗、电费和避坑步骤。

N100 跑本地大模型够用吗?我折腾 7 天,拿 Qwen2.5-7B 和旧笔记本、3060、云 API 各测了一轮

图片

我先说结论:N100 能跑,但“能跑”和“能用”差得不是一点。 上个月我把吃灰的 N100 小主机(8GB 内存,后来加到 16GB 单通道 DDR4-3200)刷了 Ubuntu 24.04,装 Ollama 0.5.x,拉 qwen2.5:7b 的 Q4_K_M。 第一次 ollama run 蹦字的时候挺激动,像 2008 年用 512K 宽带下 MP3。 结果问它“写个 Python 读 CSV 去重”,等了 43 秒首 token,后面生成速度 2.8 tok/s,一篇 800 字回答要 5 分半。 那一刻我就知道,这玩意适合折腾,不适合当主力。

我手头正好有三台能对比:N100 16GB 单通道 DDR4-3200、旧笔记本 i5-8250U 16GB 双通道 DDR4-2400、台式机 RTX 3060 12G + R5 5600。 都用 Ollama 默认参数,模型 Qwen2.5-7B-Instruct Q4_K_M,num_ctx 2048,问同一个问题:“用 200 字解释 TCP 三次握手”。 N100:首 token 4.8 秒,生成 2.8 tok/s,整机满载 28W,风扇 42dB。 旧笔记本:首 token 3.1 秒,生成 4.1 tok/s,满载 45W。 3060 12G:首 token 0.4 秒,生成 52 tok/s,满载 250W。 云 API:首 token 0.6 秒,生成 60+ tok/s,几乎不占本地电。 看出来了吗?N100 的问题不是 CPU 太弱,是单通道内存带宽卡脖子,Q4 7B 约 4.7GB,每次生成都要搬权重,DDR4-3200 单通道理论 25.6GB/s,实际能用的更少。

算笔账:N100 满载 28W,一天 24 小时 0.672 度,按 0.55 元/度,一个月 11 块。 旧笔记本 45W,一个月 17.8 块。 3060 台式机 250W,一个月 99 块——这还没算空调。 但如果你只是每天问 20 个问题,云 API 可能一个月花不到 10 块。 所以“本地跑省钱”这个理由,在 N100 上基本不成立,除非你跑批量任务、断网、或者数据不能出局域网。 我后来把 N100 降到 qwen2.5:3b Q4_K_M,生成 8.5 tok/s,首 token 1.9 秒,写周报、改邮件勉强能用;1.5B 能到 15 tok/s,但回答开始飘,问东答西。 7B 在 N100 上?我不建议当日常。

图片

如果你已经买了 N100,别急着退货,可以按这个步骤压榨一下。 第一步,内存必须 16GB 起,能双通道就双通道;很多 N100 小主机只有一条 SODIMM,买之前问清楚。 第二步,装 Ubuntu 24.04 或 Debian 12,别用 Windows 11,光系统就吃 4GB。 第三步,装 Ollama:curl -fsSL https://ollama.com/install.sh | sh,然后 ollama pull qwen2.5:3b。 第四步,跑之前设环境变量:OLLAMA_NUM_PARALLEL=1OLLAMA_MAX_LOADED_MODELS=1,否则内存直接爆。 第五步,用 ollama run qwen2.5:3b --verbose 看 eval rate,别凭感觉。 第六步,把 num_ctx 从 2048 开始,别一上来 8192,上下文越长内存越涨、速度越慢。 第七步,远程访问用 Tailscale + Open WebUI,端口 3000,别把 Ollama 11434 直接暴露公网,我扫过日志,真有脚本在找。

独立观点:N100 跑本地大模型的正确姿势,不是“替代 ChatGPT”,而是“当离线小助手 + 学习机”。 适合:断网环境查命令、RAG 检索本地 PDF、批量给 100 条评论打标签、给 Home Assistant 做语音意图解析。 不适合:写长文、写复杂代码、翻译整本书、多轮长上下文。 想认真本地跑 7B/14B,最低建议 32GB 双通道 DDR5 + 核显,或者二手 3060 12G / 4060 8G;再往上就是 Mac mini M4 24GB。 别信“N100 秒变 AI 服务器”的标题,那东西 TDP 才 6W,物理规律不跟你讲情怀。

我现在把 N100 挂着 qwen2.5:3b,只干三件事:每天把 RSS 摘要成 5 条、把会议录音转写后的文本做简单分段、断网时查 Docker 命令。 7B 挪到 3060 那台,云 API 留给写代码和长文。 这样分工之后,电费没涨多少,脾气倒是好了不少。 如果你正在搜“N100 跑本地大模型够用吗”,我的答案:3B 够用,7B 能跑但别指望,14B 想都别想。 先看内存通道和带宽,再看 token/s,最后看电费,别反过来。

🏷️ 标签: