Hướng dẫn sử dụng Ollama: Nhập môn chạy mô hình AI cục bộ trên máy tính của bạn
Ollama đơn giản hóa việc chạy các mô hình ngôn ngữ lớn cục bộ chỉ bằng vài dòng lệnh, giữ toàn bộ dữ liệu trên máy. Bài viết này hướng dẫn bạn cách cài đặt, tải mô hình, tiết kiệm bộ nhớ bằng lượng tử hóa và kết nối API.
Chạy mô hình AI ngay trên laptop mà không cần kết nối đám mây
Ollama giải quyết một vấn đề rất thiết thực—"Tôi muốn dùng mô hình ngôn ngữ lớn, nhưng không muốn đưa dữ liệu lên đám mây của người khác". Công cụ này đơn giản hóa việc chạy LLM cục bộ (local LLM) vốn rất rườm rà trước đây thành chỉ vài dòng lệnh: cài đặt, ollama pull để tải mô hình, và ollama run để bắt đầu trò chuyện, thế là xong. Nền tảng bên dưới là llama.cpp, sử dụng định dạng GGUF, giúp Metal trên Mac, CUDA của NVIDIA và Vulkan hiện tại đều dùng chung một loại tệp. Khi chạy trên MacBook của mình, tôi thấy thao tác này nhẹ nhàng hơn rất nhiều so với quy trình phải biên dịch hàng đống thứ của hai năm trước.
Ollama có thể làm gì
- Cài đặt chỉ bằng một dòng lệnh, tự động xử lý việc tải mô hình, nhận diện GPU và dịch vụ API
ollama pull/ollama runlà có thể tải về và trò chuyện ngay, chủ yếu sử dụng giao diện dòng lệnh (CLI)- Kho mô hình có hơn 100 loại (Llama, Qwen, Gemma, DeepSeek, v.v.)
- Tích hợp sẵn REST API và tương thích với định dạng của OpenAI, thuận tiện tích hợp vào chương trình riêng của bạn
- Tùy chỉnh thông số mô hình bằng Modelfile (giống như Dockerfile phiên bản dành cho LLM)
- Hỗ trợ Docker, toàn bộ dữ liệu ở lại máy cục bộ, không bị rò rỉ ra ngoài
Cách bắt đầu sử dụng (Các bước)
- Truy cập trang web chính thức để tải và cài đặt Ollama (có sẵn cho macOS / Windows / Linux)
- Mở terminal và nhập
ollama pull qwen3:8bđể tải một mô hình về (mức dung lượng 8B rất phù hợp để laptop thông thường bắt đầu) - Nhập
ollama run qwen3:8b, đợi mô hình tải xong là có thể trò chuyện trực tiếp trong terminal - Nếu muốn tích hợp vào chương trình, hãy mở API tích hợp sẵn (mặc định tại http://localhost:11434) và gọi bằng định dạng tương thích với OpenAI
- Nếu muốn tùy chỉnh, hãy viết một tệp Modelfile, thiết lập các thông số như system prompt, temperature, sau đó dùng lệnh
ollama create
Mẹo nâng cao
- Nếu không đủ bộ nhớ, hãy chọn phiên bản lượng tử hóa (quantized): Q4_K_M (4-bit) tiết kiệm khoảng 75% bộ nhớ, mô hình 7B giảm từ ~16GB xuống còn ~4GB mà chất lượng giảm đi rất ít
- Kích thước mô hình phải phù hợp với phần cứng: RAM 8GB chạy được mô hình từ 3B đến 8B, từ 16GB trở lên mới chạy mượt các mô hình từ 13B trở lên
- Các tệp GGUF tải từ Hugging Face có thể được nhập bằng Modelfile, không bị giới hạn trong kho chính thức
- Nếu muốn có giao diện đồ họa (GUI), bạn có thể kết hợp với LM Studio hoặc các giao diện người dùng front-end khác, rất thân thiện với những ai không quen dùng CLI
- Tích hợp điểm cuối (endpoint) tương thích với OpenAI của Ollama vào các ứng dụng hiện có của bạn mà hầu như không cần sửa đổi SDK
Những điểm cần lưu ý
- Khả năng của mô hình chạy cục bộ thường không bằng các mô hình đám mây hàng đầu như GPT hay Claude, đừng kỳ vọng chúng giống hệt nhau
- Ngốn phần cứng: Nếu không có card màn hình rời hoặc dung lượng RAM nhỏ, các mô hình lớn sẽ chạy rất chậm hoặc thậm chí không chạy nổi
- Lần đầu tải mô hình có thể nặng tới vài GB, hãy chú ý đến kết nối mạng và dung lượng ổ cứng
- Mặc dù dữ liệu không bị rò rỉ ra ngoài, bạn vẫn phải tự quản lý bảo mật trên máy cục bộ (ai có quyền truy cập vào máy này, API có bị lộ hay không)
Tổng kết và đánh giá từ TheAI學院
Thành thật mà nói, Ollama là công cụ mà tôi sẽ giới thiệu thẳng cho hai nhóm người: "những ai coi trọng quyền riêng tư" và "những ai muốn tìm hiểu cách LLM hoạt động". Trong các lĩnh vực pháp lý, y tế, nghiên cứu và phát triển—nơi dữ liệu tuyệt đối không được truyền ra ngoài—mô hình cục bộ là một trong số ít các giải pháp khả thi; còn đối với các nhà phát triển, nó ép chi phí thử nghiệm xuống gần như bằng không—muốn đổi mô hình thì pull, muốn gọi API thì dùng endpoint tương thích OpenAI, hầu như không phải sửa code. Giới hạn trần của nó chính là phần cứng của bạn và năng lực của các mô hình mã nguồn mở. Hai năm qua, các mô hình mã nguồn mở đã tiến bộ rất nhanh, và phương pháp lượng tử hóa 4-bit giúp các dòng laptop thông thường cũng có thể chạy mượt mà, con đường này sẽ ngày càng rộng mở hơn. Nếu bạn chỉ cần một công cụ trò chuyện dễ dùng, ChatGPT hay Claude trên đám mây vẫn tiện lợi hơn; nhưng ngay khi xuất hiện yêu cầu "dữ liệu tuyệt đối không được rò rỉ", Ollama hoàn toàn xứng đáng để bạn dành một buổi chiều cài đặt và trải nghiệm. Đọc thêm: Hướng dẫn thực tế về quyền riêng tư và bảo mật AI, Cách sử dụng LM Studio.
Đánh giá một câu: Ollama biến việc chạy LLM cục bộ thành vài dòng lệnh đơn giản, rất thích hợp cho những ai quan tâm đến quyền riêng tư và muốn tìm hiểu về LLM; giới hạn năng lực phụ thuộc vào phần cứng và mô hình mã nguồn mở của bạn, nhưng lượng tử hóa 4-bit giúp cả laptop thông thường cũng chạy được.
Nguồn dữ liệu
Được tổng hợp dựa trên các thông báo chính thức và tài liệu công khai, vui lòng tham khảo thông tin chính thức để có độ chính xác cao nhất.
Hiểu lầm phổ biến / Phá bỏ lầm tưởng
Một số người có thể hiểu nhầm mô hình AI chạy cục bộ của Ollama là công cụ "hoàn toàn không cần internet", nhưng thực tế, trong lần tải mô hình đầu tiên vẫn cần có kết nối mạng. Ngoài ra, mặc dù các mô hình của Ollama không gửi dữ liệu của người dùng ra bên ngoài, người dùng vẫn cần chú ý đến vấn đề bảo mật trên thiết bị cục bộ của mình, chẳng hạn như ai có quyền truy cập vào máy tính này, API có bị rò rỉ hay không, v.v. Đồng thời, mặc dù năng lực của Ollama không thua kém một số mô hình đám mây, nó vẫn bị giới hạn bởi phần cứng và khả năng của các mô hình mã nguồn mở.
Lựa chọn mô hình phù hợp
| Mô hình | Mức dung lượng | Yêu cầu bộ nhớ | Phần cứng phù hợp |
|---|---|---|---|
| Qwen3:8b | 8B | ~16GB | Laptop thông thường |
| Q4_K_M (4-bit) | 7B | ~4GB | Phần cứng cấu hình thấp hơn |
| Llama | 13B | ~32GB | Laptop cao cấp hoặc máy chủ |
Việc lựa chọn mô hình phù hợp đòi hỏi phải cân nhắc các giới hạn của phần cứng, chẳng hạn như dung lượng bộ nhớ và năng lực của GPU. Nhìn chung, laptop có RAM 8GB có thể chạy các mô hình từ 3B đến 8B, trong khi RAM từ 16GB trở lên mới thực sự phù hợp để chạy các mô hình từ 13B trở lên.
Các bước thực tế: Tùy chỉnh mô hình
Ollama cung cấp tính năng Modelfile, cho phép người dùng tùy chỉnh các thông số của mô hình như system prompt, temperature, v.v. Dưới đây là các bước để tùy chỉnh mô hình:
- Viết một tệp Modelfile và thiết lập các thông số mong muốn.
- Chạy lệnh
ollama createđể tạo mô hình tùy chỉnh. - Chạy lệnh
ollama runđể khởi chạy mô hình tùy chỉnh đó.
Xu hướng tương lai
Cùng với sự tiến bộ của các mô hình mã nguồn mở và sự nâng cấp của phần cứng, khả năng của Ollama sẽ ngày càng trở nên mạnh mẽ hơn. Trong tương lai, có thể sẽ có thêm nhiều mô hình và tính năng được tích hợp vào Ollama, chẳng hạn như hỗ trợ nhiều nền tảng phần cứng hơn, cải thiện độ chính xác của mô hình, v.v. Đồng thời, số lượng người dùng Ollama cũng có thể sẽ ngày càng tăng lên, đặc biệt là trong các ngành đòi hỏi tính bảo mật cao như pháp lý, y tế, nghiên cứu và phát triển, v.v.
Câu hỏi thường gặp
Ollama là gì?
Một công cụ cho phép bạn chạy các mô hình ngôn ngữ lớn cục bộ trên máy tính của mình, với nền tảng là llama.cpp và định dạng mô hình là GGUF. Sau khi cài đặt bằng một dòng lệnh, bạn chỉ cần dùng ollama pull/run để tải xuống và trò chuyện.
Sử dụng Ollama như thế nào?
Sau khi cài đặt, nhập ollama pull để tải mô hình (như qwen3:8b), sau đó dùng ollama run để bắt đầu trò chuyện; nếu muốn kết nối với lập trình, bạn có thể sử dụng REST API tương thích OpenAI được tích hợp sẵn (localhost:11434).
Chạy Ollama cần phần cứng gì?
Tùy thuộc vào kích thước mô hình: RAM 8GB có thể chạy 3B~8B, từ 16GB trở lên sẽ phù hợp hơn cho các dòng từ 13B trở lên; sử dụng lượng tử hóa 4-bit Q4_K_M có thể tiết kiệm khoảng 75% bộ nhớ, mô hình 7B chỉ cần khoảng 4GB.
Ollama khác gì với ChatGPT?
Ollama chạy cục bộ, dữ liệu không bị rò rỉ ra ngoài, có thể dùng ngoại tuyến và không cần trả phí thuê bao, nhưng năng lực bị giới hạn bởi phần cứng và các mô hình mã nguồn mở; ChatGPT là mô hình đám mây cao cấp, mạnh mẽ và tiện lợi hơn, nhưng dữ liệu sẽ được đưa lên đám mây.