Ollama 使用教学:在自己电脑上跑本地 AI 模型入门

Ollama 把跑本地大型语言模型简化成几行指令,资料全留本机。这篇教你安装、下载模型、用量化省记忆体、接 API。

在自己的笔电上,跑一个不连云端的 AI 模型

Ollama 解决的是一件很实际的事——『我想用大型语言模型,但不想把资料丢上别人的云』。它把跑本地 LLM 这件原本很麻烦的事,简化成几行指令:装好、ollama pull 下载模型、ollama run 开始对话,就这样。底层是 llama.cpp,模型用 GGUF 格式,Mac 的 Metal、NVIDIA 的 CUDA、还有 Vulkan 现在都吃同一种档案。我自己在 MacBook 上跑,比两年前那套要编译一堆东西的流程,轻松太多了。

Ollama 能做什么

  • 一行指令安装,自动处理模型下载、GPU 侦测、API 服务
  • ollama pullollama run 就能下载并开聊,CLI 为主
  • 模型库超过 100 种(Llama、Qwen、Gemma、DeepSeek 等)
  • 内建 REST API,且相容 OpenAI 格式,方便接进自己的程式
  • 用 Modelfile 自订模型参数(像 LLM 版的 Dockerfile)
  • 支援 Docker,资料全留在本机、不外流

怎么开始用(步骤)

  1. 到官网下载安装 Ollama(macOS/Windows/Linux 都有)
  2. 开终端机输入 ollama pull qwen3:8b 下载一个模型(8B 量级适合一般笔电起步)
  3. 输入 ollama run qwen3:8b,等它载入后就能直接在终端机对话
  4. 要接进程式就打开内建 API(预设 http://localhost:11434),用 OpenAI 相容格式呼叫
  5. 想客制化就写一份 Modelfile,设定系统提示、温度等参数再 ollama create

进阶技巧

  • 记忆体不够就选量化版:Q4_K_M(4-bit)约省 75% 记忆体,7B 模型从 ~16GB 降到 ~4GB,品质掉很少
  • 模型大小要配硬体:8GB 记忆体跑 3B~8B、16GB 以上才比较顺跑 13B 以上
  • 从 Hugging Face 抓的 GGUF 档可以用 Modelfile 汇入,不限官方库
  • 要图形介面可搭 LM Studio 或前端 UI,CLI 不顺手的人友善很多
  • 把 Ollama 的 OpenAI 相容端点接进你现有的程式,几乎不用改 SDK

要注意的事

  • 本地模型的能力通常比不上 GPT、Claude 这种顶规云端模型,别期待一模一样
  • 吃硬体:没有独显或记忆体小,大模型会很慢甚至跑不动
  • 首次下载模型动辄数 GB,留意网路与硬碟空间
  • 虽然资料不外流,但本机安全(谁能存取这台机器、API 有没有曝露)还是要自己顾

TheAI学院 总结与评语

老实说,Ollama 是我会直接推荐给『在意隐私』和『想学 LLM 怎么运作』两种人的工具。法务、医疗、研发这些不能把资料外传的场景,本地模型是少数解法;而对开发者来说,它把实验成本压到几乎是零——想换模型就 pull 一个,想接 API 就用 OpenAI 相容端点,几乎不用改程式。它的天花板就是你的硬体和开源模型的能力,这两年开源模型进步很快,4-bit 量化又让一般笔电也跑得动,这条路只会越走越宽。如果你只是要好用的对话,云端的 ChatGPTClaude 还是更省事;但只要『资料不能外流』这条线出现,Ollama 就值得你花一个下午装起来玩。延伸阅读:AI 隐私与资安实用指南LM Studio 怎么用

一句话评语:Ollama 把跑本地 LLM 变成几行指令,最适合在意隐私和想学 LLM 的人;能力天花板看你的硬体和开源模型,但 4-bit 量化让一般笔电也跑得动。

资料来源

依官方公告与公开资料整理、以官方为准。

常见误解 / 破除迷思

有些人可能会误解 Ollama 的本地 AI 模型为「完全不需要网路」的工具,但事实上,第一次下载模型时仍需要网路连线。另外,虽然 Ollama 的模型不会将使用者的资料外传,但使用者仍需要注意本机的安全性,例如谁能存取这台机器、API 有没有曝露等问题。同时,Ollama 的能力虽然不亚于一些云端模型,但仍受限于硬体和开源模型的能力。

选择合适的模型

模型 量级 记忆体需求 适合硬体
Qwen3:8b 8B ~16GB 一般笔电
Q4_K_M(4-bit) 7B ~4GB 较低端硬体
Llama 13B ~32GB 高端笔电或伺服器

选择合适的模型需要考虑硬体的限制,例如记忆体和GPU的能力。一般来说,8GB记忆体的笔电可以跑3B~8B的模型,而16GB以上的记忆体才比较适合跑13B以上的模型。

实用步骤:客制化模型

Ollama 提供了 Modelfile 的功能,允许使用者客制化模型的参数,例如系统提示、温度等。以下是客制化模型的步骤:

  1. 撰写一份 Modelfile,设定所需的参数。
  2. 执行 ollama create 指令,创建客制化模型。
  3. 执行 ollama run 指令,启动客制化模型。

未来趋势

随着开源模型的进步和硬体的升级,Ollama 的能力将会越来越强大。未来,可能会有更多的模型和功能被加入到 Ollama 中,例如支持更多的硬体平台、改善模型的准确性等。同时,Ollama 的使用者也可能会越来越多,特别是在需要保密的行业中,例如法务、医疗、研发等。

常见问题

Ollama 是什么?

一个让你在自己电脑上跑本地大型语言模型的工具,底层为 llama.cpp、模型用 GGUF 格式,一行指令安装后用 ollama pull/run 即可下载与对话。

Ollama 怎么用?

安装后输入 ollama pull 下载模型(如 qwen3:8b),再 ollama run 开始对话;要接程式可用内建的 OpenAI 相容 REST API(localhost:11434)。

跑 Ollama 需要什么硬体?

看模型大小:8GB 记忆体可跑 3B~8B,16GB 以上较适合 13B 以上;用 Q4_K_M 4-bit 量化可省约 75% 记忆体,7B 模型约只要 4GB。

Ollama 和 ChatGPT 差在哪?

Ollama 在本机执行、资料不外流、可离线且免订阅,但能力受硬体与开源模型限制;ChatGPT 是云端顶规模型、更强更省事,但资料会上云。

繁體中文版 →