Ollama 使用教学:在自己电脑上跑本地 AI 模型入门
Ollama 把跑本地大型语言模型简化成几行指令,资料全留本机。这篇教你安装、下载模型、用量化省记忆体、接 API。
在自己的笔电上,跑一个不连云端的 AI 模型
Ollama 解决的是一件很实际的事——『我想用大型语言模型,但不想把资料丢上别人的云』。它把跑本地 LLM 这件原本很麻烦的事,简化成几行指令:装好、ollama pull 下载模型、ollama run 开始对话,就这样。底层是 llama.cpp,模型用 GGUF 格式,Mac 的 Metal、NVIDIA 的 CUDA、还有 Vulkan 现在都吃同一种档案。我自己在 MacBook 上跑,比两年前那套要编译一堆东西的流程,轻松太多了。
Ollama 能做什么
- 一行指令安装,自动处理模型下载、GPU 侦测、API 服务
ollama pull/ollama run就能下载并开聊,CLI 为主- 模型库超过 100 种(Llama、Qwen、Gemma、DeepSeek 等)
- 内建 REST API,且相容 OpenAI 格式,方便接进自己的程式
- 用 Modelfile 自订模型参数(像 LLM 版的 Dockerfile)
- 支援 Docker,资料全留在本机、不外流
怎么开始用(步骤)
- 到官网下载安装 Ollama(macOS/Windows/Linux 都有)
- 开终端机输入
ollama pull qwen3:8b下载一个模型(8B 量级适合一般笔电起步) - 输入
ollama run qwen3:8b,等它载入后就能直接在终端机对话 - 要接进程式就打开内建 API(预设 http://localhost:11434),用 OpenAI 相容格式呼叫
- 想客制化就写一份 Modelfile,设定系统提示、温度等参数再
ollama create
进阶技巧
- 记忆体不够就选量化版:Q4_K_M(4-bit)约省 75% 记忆体,7B 模型从 ~16GB 降到 ~4GB,品质掉很少
- 模型大小要配硬体:8GB 记忆体跑 3B~8B、16GB 以上才比较顺跑 13B 以上
- 从 Hugging Face 抓的 GGUF 档可以用 Modelfile 汇入,不限官方库
- 要图形介面可搭 LM Studio 或前端 UI,CLI 不顺手的人友善很多
- 把 Ollama 的 OpenAI 相容端点接进你现有的程式,几乎不用改 SDK
要注意的事
- 本地模型的能力通常比不上 GPT、Claude 这种顶规云端模型,别期待一模一样
- 吃硬体:没有独显或记忆体小,大模型会很慢甚至跑不动
- 首次下载模型动辄数 GB,留意网路与硬碟空间
- 虽然资料不外流,但本机安全(谁能存取这台机器、API 有没有曝露)还是要自己顾
TheAI学院 总结与评语
老实说,Ollama 是我会直接推荐给『在意隐私』和『想学 LLM 怎么运作』两种人的工具。法务、医疗、研发这些不能把资料外传的场景,本地模型是少数解法;而对开发者来说,它把实验成本压到几乎是零——想换模型就 pull 一个,想接 API 就用 OpenAI 相容端点,几乎不用改程式。它的天花板就是你的硬体和开源模型的能力,这两年开源模型进步很快,4-bit 量化又让一般笔电也跑得动,这条路只会越走越宽。如果你只是要好用的对话,云端的 ChatGPT、Claude 还是更省事;但只要『资料不能外流』这条线出现,Ollama 就值得你花一个下午装起来玩。延伸阅读:AI 隐私与资安实用指南、LM Studio 怎么用。
一句话评语:Ollama 把跑本地 LLM 变成几行指令,最适合在意隐私和想学 LLM 的人;能力天花板看你的硬体和开源模型,但 4-bit 量化让一般笔电也跑得动。
资料来源
依官方公告与公开资料整理、以官方为准。
常见误解 / 破除迷思
有些人可能会误解 Ollama 的本地 AI 模型为「完全不需要网路」的工具,但事实上,第一次下载模型时仍需要网路连线。另外,虽然 Ollama 的模型不会将使用者的资料外传,但使用者仍需要注意本机的安全性,例如谁能存取这台机器、API 有没有曝露等问题。同时,Ollama 的能力虽然不亚于一些云端模型,但仍受限于硬体和开源模型的能力。
选择合适的模型
| 模型 | 量级 | 记忆体需求 | 适合硬体 |
|---|---|---|---|
| Qwen3:8b | 8B | ~16GB | 一般笔电 |
| Q4_K_M(4-bit) | 7B | ~4GB | 较低端硬体 |
| Llama | 13B | ~32GB | 高端笔电或伺服器 |
选择合适的模型需要考虑硬体的限制,例如记忆体和GPU的能力。一般来说,8GB记忆体的笔电可以跑3B~8B的模型,而16GB以上的记忆体才比较适合跑13B以上的模型。
实用步骤:客制化模型
Ollama 提供了 Modelfile 的功能,允许使用者客制化模型的参数,例如系统提示、温度等。以下是客制化模型的步骤:
- 撰写一份 Modelfile,设定所需的参数。
- 执行
ollama create指令,创建客制化模型。 - 执行
ollama run指令,启动客制化模型。
未来趋势
随着开源模型的进步和硬体的升级,Ollama 的能力将会越来越强大。未来,可能会有更多的模型和功能被加入到 Ollama 中,例如支持更多的硬体平台、改善模型的准确性等。同时,Ollama 的使用者也可能会越来越多,特别是在需要保密的行业中,例如法务、医疗、研发等。
常见问题
Ollama 是什么?
一个让你在自己电脑上跑本地大型语言模型的工具,底层为 llama.cpp、模型用 GGUF 格式,一行指令安装后用 ollama pull/run 即可下载与对话。
Ollama 怎么用?
安装后输入 ollama pull 下载模型(如 qwen3:8b),再 ollama run 开始对话;要接程式可用内建的 OpenAI 相容 REST API(localhost:11434)。
跑 Ollama 需要什么硬体?
看模型大小:8GB 记忆体可跑 3B~8B,16GB 以上较适合 13B 以上;用 Q4_K_M 4-bit 量化可省约 75% 记忆体,7B 模型约只要 4GB。
Ollama 和 ChatGPT 差在哪?
Ollama 在本机执行、资料不外流、可离线且免订阅,但能力受硬体与开源模型限制;ChatGPT 是云端顶规模型、更强更省事,但资料会上云。