作者: Adrian Punk @AdrianPunk115

最近终于拿到了自己的 Linux 电脑,我开始拿它折腾本地大模型。这台机器装的是 Ubuntu 24.04,处理器是 AMD Ryzen AI MAX+ 395,配了 Radeon 8060S 和 128GB 统一内存,硬件很适合测试大参数模型。
一开始,我安装的是 Qwen3.7 27B 的未审查版本,体验了一把未审查的快乐!最近 Qwen3.8 27B 发布,我又重新跑了一遍完整部署。

为什么还要花时间部署到本地?对我来说,理由都很实际:
所以我把这次安装过程完整记录了下来。没有命令行基础也没关系,文中会解释每一个容易卡住的名词、每一条命令在做什么,以及看到什么结果才算安装成功。
最后只需要一条命令,就能在自己的 Windows 或 Linux 电脑里跑起千问 Qwen3.8 27B。模型下载约 13GB,断网也能聊,文件和对话不用先传到云端。
下面分成 Windows 和 Linux 两种安装方法。Windows 使用图形安装包,Linux 使用官方安装脚本;从下载模型开始,两边使用同一条核心命令。
最终要运行的核心命令只有这一条:
ollama run Julioa/Qwen3.8-27B-UD-Q3_K_XL先别急着复制。27B 模型比普通软件大得多,安装成功和用得舒服也不是同一个标准。前面的名词解释两种系统都通用;从第 2 章开始,按 Windows 或 Linux 小标题走自己的路线即可。
第一次接触本地大模型,最容易被一串名字劝退:Linux、Ollama、27B、GGUF、Q3、ROCm。
先把核心命令翻译成人话:
“让 Ollama 去下载 Julioa 发布的 千问 Qwen3.8 27B 压缩模型,然后在这台电脑上启动它。”
平时打开网页使用 AI,你输入的问题会通过网络发到服务商的服务器,答案算完后再传回来。本地化部署是把模型文件下载到自己的硬盘,再用自己的 CPU、GPU 和内存完成计算。
它带来三个很直接的变化:
可以把云端模型理解成叫网约车,本地模型更像自己买车。 前者省心,后者掌控感更强,也要自己负责停车位、油耗和保养。

参数更多不保证每次回答都更好,但通常会带来更高的硬件门槛。8B 模型像一只登机箱,27B 已经接近大号托运行李,电脑得先腾出足够的位置。
模型权重只是一堆文件,自己不会弹出聊天窗口。Ollama 负责三件事:
你可以把它理解成本地大模型的启动器。类似 Steam 管理游戏,Ollama 管理大模型。
原始 27B 模型很大(未压缩时需要 50GB+ 显存)。为了让个人电脑装得下,社区会对模型做量化(Quantization)。
量化可以理解成压缩照片:保留主体画面细节,同时降低每个参数使用的浮点精度,换来更小的文件体积和更低的显存占用。
模型名里的 Q3 表示大约 3-bit 级别的量化,K 是一类改进型量化算法,XL 是发布者对这个变体的命名。本教程选它的理由很现实:这台 128GB 统一内存的机器能完整加载,实测运行尺寸约 29GB,还能把模型全部交给 GPU!

Token 是模型读写文字时使用的最小词元单位(一个汉字约占 1~2 token)。上下文(Context Length) 是模型当前一次能“记住”的全部内容(包含问题、历史对话和附加资料)。上下文开得越长,额外占用的 KV Cache 显存/内存就越多。
先花两分钟检查环境。模型下载到 90% 才发现磁盘不够,最浪费时间。


在 Ubuntu 终端中执行官方一键安装命令:
curl -fsSL https://ollama.com/install.sh | sh安装完成后,检查后台服务运行状态:sudo systemctl status ollama --no-pager。只要看到 Active: active (running) 即代表成功。

从这一步开始,Windows 和 Linux 使用完全同一条命令!
ollama run Julioa/Qwen3.8-27B-UD-Q3_K_XL命令拆解:
首次运行会自动下载 13GB 权重文件(支持断点续传)。下载完成后即可进入交互式对话,输入:
请只回复一句:千问 Qwen3.8 27B 已在这台电脑本地运行。
看到中文回答即代表本地大模型的 Hello World 成功!输入 /bye 即可安全退出。
模型会回答,只能证明它启动了。CPU 也能计算,但速度可能只有 1~2 token/s。我们需要确保它100% 运行在 GPU 上!

在模型保持运行的同时,打开第二个终端或 PowerShell 窗口执行:
ollama ps
看到 PROCESSOR: 100% GPU 即代表全部 66 层神经网络算子均由显卡加速!

Ollama 原生提供了与 OpenAI 规范兼容的本地 HTTP 接口,默认监听在 http://127.0.0.1:11434。
使用 Linux / macOS 终端 curl 发送测试请求:
curl -s http://127.0.0.1:11434/api/chat \
-H 'Content-Type: application/json' \
-d '{
"model": "Julioa/Qwen3.8-27B-UD-Q3_K_XL",
"stream": false,
"messages": [
{"role": "user", "content": "请用一句中文确认你正在本地运行。"}
],
"options": {"num_ctx": 32768}
}' | python3 -m json.tool如果看到返回带有 "done": true 和具体回答内容,说明本地 API 已经完全打通!
如果你不喜欢一直对着黑底白字的命令行打字,推荐搭配以下优秀的本地开源图形界面:
功能最强、媲美 ChatGPT 网页版,支持知识库 RAG、代码高亮与联网检索。
轻量级桌面客户端(支持 Win/Mac/Linux/iOS/Android),直接填入 127.0.0.1:11434 即可使用。
Chrome / Edge 浏览器侧边栏插件,随时用本地模型总结当前打开的网页。