ຄູ່ມືການໃຊ້ງານ Ollama: スタートແລ່ນ AI Model ໄວ້ໃນເຄື່ອງຄອມພິວເຕີຂອງທ່ານເອງ

Ollama ໄດ້ສ້າງຄວາມສະດວກໃນການຣັນ Large Language Model ໄວ້ໃນເຄື່ອງຂອງທ່ານດ້ວຍຄຳສັ່ງພຽງບໍ່ເທົ່າໃດແຖວ ແລະ ຂໍ້ມູນທັງໝົດຈະຢູ່ In-house. ບົດຄວາມນີ້ຈະສອນວິທີຕິດຕັ້ງ, ດາວໂຫຼດ Model, ໃຊ້ Quantization ປະຫຍັດ RAM ແລະ ເຊື່ອມຕໍ່ API.

ວິທີແລ່ນ ໂມເດວ AI ຢູ່ໃນ ल्याບທັອບ (Laptop) ຂອງເຈົ້າເອງ ໂດຍບໍ່ຕ້ອງເຊື່ອມຕໍ່ກັບ Cloud

Ollama ແກ້ໄຂບັນຫາທີ່ເປັນຮູບປະທຳຢ່າງໜຶ່ງ ຄື: "ຂ້ອຍຢາກໃຊ້ Large Language Model, ແຕ່ບໍ່ຢາກສົ່ງຂໍ້ມູນໄປໃສ່ Cloud ຂອງຄົນອື່ນ." ມັນຊ່ວຍເຮັດໃຫ້ການຣັນ LLM ໃນເຄື່ອງ (Local LLM) ເຊິ່ງປົກກະຕິແລ້ວຫຍຸ້ງຍາກຫຼາຍ ໃຫ້ກາຍເປັນເລື່ອງງ່າຍດ້ວຍຄຳສັ່ງພຽງບໍ່ເທົ່າໃດບັນທັດ ຄື: ຕິດຕັ້ງ, ollama pull ເພື່ອດາວໂຫຼດໂມເດວ, ແລະ ollama run ເພື່ອເລີ່ມຕົ້ນສົນທະນາ, ພຽງເທົ່ານີ້ກໍ່ສຳເລັດ. ລະບົບພື້ນຫຼັງແມ່ນ llama.cpp, ໂມເດວໃຊ້ຮູບແບບ GGUF ໂດຍ Metal ຂອງ Mac, CUDA ຂອງ NVIDIA, ແລະ Vulkan ຕອນນີ້ລ້ວນແຕ່ຮອງຮັບໄຟລ໌ປະເພດດຽວກັນນີ້ແລ້ວ. ສຳລັບຂ້ອຍເອງທີ່ລອງຣັນເທິງ MacBook, ມັນສະດວກສະບາຍກວ່າຂັ້ນຕອນການຄອມໄພລ໌ (Compile) ຫຼາຍຢ່າງເມື່ອສອງປີກ່ອນຫຼາຍ.

Ollama ເຮັດຫยังໄດ້ແດ່

  • ติดตั้งດ້ວຍຄຳສັ່ງດຽວ, ລະບົບຈັດການການດາວໂຫຼດໂມເດວ, ตรวจจับ GPU ແລະ ບໍລິການ API ໃຫ້ໂດຍອັດຕະໂນມັດ
  • ollama pullollama run ໃຊ້ສຳລັບດາວໂຫຼດແລະເລີ່ມສົນທະນາໄດ້ເລີຍ, ໂດຍເນັ້ນການໃຊ້ CLI ເປັນຫຼັກ
  • ມີຄັງໂມເດວຫຼາຍກວ່າ 100 แบบ (Llama, Qwen, Gemma, DeepSeek ແລະ ⁠ອື່ນໆ)
  • ມີ REST API ໃນຕົວ, ແລະ ຍັງຮອງຮັບຮູບແບບຂອງ OpenAI, ເຊິ່ງສະດວກໃນການເຊື່ອມຕໍ່ເຂົ້າກັບโปรแกรมຂອງເຈົ້າເອງ
  • ໃຊ້ Modelfile ເພື່ອປັບແຕ່ງຄ່າພາຣາະເເຕີຂອງໂມເດວ (ຄ້າຍຄືກັບ Dockerfile ເວີຊັນ LLM)
  • ຮອງຮັບ Docker, ຂໍ້ມູນທັງໝົດຈະຖືກເກັບໄວ້ໃນເຄື່ອງ, ບໍ່ມີການຮົ່ວໄຫຼອອກຂ້າງນອກ

ວິທີເລີ່ມຕົ້ນໃຊ້ງານ (ຂັ້ນຕອນ)

  1. ເຂົ້າໄປທີ່ເວັບໄຊທ໌ທາງການເພື່ອດາວໂຫຼດ ແລະ ຕິດຕັ້ງ Ollama (ມີໃຫ້ທັງ macOS, Windows ແລະ Linux)
  2. เปิด Terminal ແລ້ວພິມຄຳສັ່ງ ollama pull qwen3:8b ເພື່ອດາວໂຫຼດໂມເດວມາ (ຂະໜາດ 8B ເໝາະສຳລັບເລີ່ມຕົ້ນໃຊ້ງານກັບແລັບທັອບທົ່ວໄປ)
  3. ພິມ ollama run qwen3:8b, ລໍຖ້າຈົນກ່ວາມັນໂຫຼດສຳເລັດ ແລ້ວສາມາດສົນທະນາຜ່ານ Terminal ໄດ້ທັນທີ
  4. ຖ້າຕ້ອງການເຊື່ອມຕໍ່ເຂົ້າກັບໂປຣແກຣມ ໃຫ້ເປີດ API ທີ່ມີມາໃນຕົວ (ຄ່າເລີ່ມຕົ້ນແມ່ນ http://localhost:11434), ແລ້ວຮຽກໃຊ້ງານຜ່ານຮູບແບບທີ່ຮອງຮັບ OpenAI
  5. ຖ້າຢາກປັບແຕ່ງຕາມຄວາມຕ້ອງການ ໃຫ້ຂຽນໄຟລ໌ Modelfile ຂຶ້ນມາ, ຕັ້ງຄ່າ System Prompt, Temperature ແລະ ຄ່າອື່ນໆ ຈາກນັ້ນໃຊ້ຄຳສັ່ງ ollama create

ວິທີການຂັ້ນສູງ

  • ຖ້າໜ່ວຍຄວາມຈຳ (Memory) ບໍ່ພໍ ໃຫ້ເລືອກເວີຊັນ Quantization: Q4_K_M (4-bit) ຊ່ວຍປະຢັດໜ່ວຍຄວາມຈຳໄດ້ປະມານ 75%, ໂມເດວ 7B ຈະຫຼຸດຈາກ ~16GB เหลือປະມານ ~4GB, ໂດຍທີ່ຄຸນນະພາບຫຼຸດລົງໜ້ອຍຫຼາຍ
  • ຂະໜາດຂອງໂມເດວຕ້ອງເໝາະສົມກັບຮາດແວ: ໜ່ວຍຄວາມຈຳ 8GB ສາມາດຣັນໂມເດວຂະໜາດ 3B~8B ໄດ້, ໜ່ວຍຄວາມຈຳ 16GB ຂຶ້ນໄປຈຶ່ງຈະສາມາດຣັນໂມເດວ 13B ຂຶ້ນໄປໄດ້ຢ່າງລຽບງ່າຍ
  • ໄຟລ໌ GGUF ที่ດາວໂຫຼດຈາກ Hugging Face ສามารถນຳເຂົ້າມາໃຊ້ຜ່ານ Modelfile ໄດ້, ບໍ່ຈຳກັດສະເພາະຄັງທາງການເທົ່ານັ້ນ
  • ຖ້າຕ້ອງການໃຊ້ງານຜ່ານ Graphic Interface ໃຫ້ໃຊ້ຮ່ວມກັບ LM Studio ຫຼື Front-end UI, ເຊິ່ງຈະເປັນມິດກັບຜູ້ທີ່ບໍ່ຄຸ້ນເຄີຍກັບການໃຊ້ CLI
  • ການນຳ Endpoint ທີ່ຮອງຮັບ OpenAI ຂອງ Ollama ไปເຊື່ອມຕໍ່ກັບໂປຣແກຣມທີ່ມີຢູ່ແລ້ວຂອງທ່ານ แทบຈະບໍ່ຈຳເປັນຕ້ອງແກ້ໄຂ SDK ເລີຍ

ສິ່ງທີ່ຄວນລະວັງ

  • ຄວາມສາມາດຂອງໂມເດວໃນເຄື່ອງ ມັກຈະສູ້ໂມເດວ Cloud ລະດັບທັອບຢ່າງ GPT ຫຼື Claude ບໍ່ໄດ້, ຢ່າຄາດຫວັງວ່າມັນຈະທຽບເທົ່າກັນທຸກປະການ
  • ກິນຊັບພະຍາກອນຮາດແວ: ຖ້າບໍ່ມີກາດຈໍແຍກ (Dedicated GPU) ຫຼື ໜ່ວຍຄວາມຈຳນ້ອຍ, ໂມເດວຂະໜາດໃຫຍ່ຈະເຮັດວຽກຊ້າຫຼາຍ ຫຼື ແມ້ກະທັ້ງຣັນບໍ່ໄດ້ເລີຍ
  • ການດາວໂຫຼດໂມເດວໃນຄັ້ງທຳອິດມີຂະໜາດໃຫຍ່ຫຼາຍ GB, ໃຫ້ກວດສອບອິນເຕີເນັດ ແລະ ພື້ນທີ່ບ່ອນຈັດເກັບຂໍ້ມູນໃນຮາດດິດໃຫ້ດີ
  • ເຖິງແມ່ນວ່າຂໍ້ມູນຈະບໍ່ຮົ່ວໄຫຼອອກຂ້າງນອກ, ແຕ່ຄວາມປອດໄພພາຍໃນເຄື່ອງ (ໃຜສາມາດເຂົ້າເຖິງເຄື່ອງນີ້ໄດ້, API ມີການເປີດເຜີຍອອກໄປ ຫລື ບໍ່) ທ່ານຍັງຄົງຕ້ອງເປັນຜູ້ดูแลດ້ວຍຕົນເອງ

TheAI學院 ບົດສະຫຼຸບ ແລະ ຄວາມເຫັນ

ເວົ້າຕາມກົງ, Ollama ຖືເປັນເຄື່ອງມືທີ່ຂ້ອຍຢາແນະນຳໃຫ້ກັບສອງກຸ່ມຄົນ ຄື: "ຜູ້ທີ່ໃຫ້ຄວາມສຳຄັນກັບຄວາມເປັນສ່ວນຕົວ" ແລະ "ຜູ້ທີ່ຢາກຮຽນຮູ້ການເຮັດວຽກຂອງ LLM". ສຳລັບສະຖານະການຕ່າງໆ ເຊັ່ນ: ວຽກງານກົດໝາຍ, ການແພດ, ການຄົ້ນຄວ້າ ແລະ ພັດທະນາ ເຊິ່ງເປັນກຸ່ມທີ່ບໍ່ສາມາດເປີດເຜີຍຂໍ້ມູນອອກສູ່ພາຍນອກໄດ້, ໂມເດວໃນເຄື່ອງແມ່ນໜຶ່ງໃນວິທີແກ້ໄຂບັນຫານ້ອຍໆ; ແລະ ສຳລັບນັກພັດທະນາແລ້ວ, ມັນຊ່ວຍຫຼຸດຕົ້ນທຶນໃນການທົດລອງລົງຈົນເກືອບເທົ່າກັບສູນ — ຖ້າຢາກປ່ຽນໂມເດວພຽງແຕ່ pull ມາ, ຖ້າຢາກເຊື່ອມຕໍ່ API ກໍ່ໃຊ້ Endpoint ທີ່ຮອງຮັບ OpenAI, แทบຈະບໍ່ຈຳເປັນຕ້ອງແກ້ໄຂโค้ດເລີຍ. ຂີດຈຳກັດຂອງມັນແມ່ນຮາດແວຂອງທ່ານ ແລະ ຄວາມສາມາດຂອງໂມເດວ Open Source, ເຊິ່ງໃນຊ່ວງສອງປີມານີ້ ໂມເດວ Open Source ມີການພັດທະນາໄປໄວຫຼາຍ, ແລະ ການເຮັດ 4-bit Quantization ກໍ່ເຮັດໃຫ້ແລັບທັອບທົ່ວໄປສາມາດຣັນໄດ້, ເສັ້ນທາງນີ້ຈຶ່ງມີແຕ່ຈະກວ້າງຂວາງຂຶ້ນເລື້ອຍໆ. ຖ້າທ່ານຕ້ອງການພຽງແຕ່ການສົນທະນາທີ່ໃຊ້ງານສະດວກ, ChatGPT ແລະ Claude ທີ່ຢູ່ເທິງ Cloud ຍังຄົງເປັນທາງເລືອກທີ່ປະຢັດແຮງກວ່າ; ແຕ່ເມື່ອໃດທີ່ມີເງື່ອນໄຂວ່າ "ຂໍ້ມູນຫ້າມຮົ່ວໄຫຼອອກຂ້າງນອກ" ປະກົດຂຶ້ນມາ, Ollama ກໍ່ຄຸ້ມຄ່າທີ່ຈະໃຫ້ເວລາທັງບ່າຍມື້ນັ້ນຕິດຕັ້ງ ແລະ ລອງຫຼິ້ນເບິ່ງ. ອ່ານເພີ່ມເຕີມ: ຄູ່ມືການໃຊ້ງານດ້ານຄວາມເປັນສ່ວນຕົວ ແລະ ຄວາມປອດໄພ AI, ວິທີການໃຊ້ງານ LM Studio.

ຄຳເຫັນໃນປະໂຫຍດດຽວ: Ollama ຊ່ວຍປ່ຽນການຣັນ LLM ໃນເຄື່ອງ ໃຫ້ກາຍເປັນຄຳສັ່ງພຽງບໍ່ເທົ່າໃດບັນທັດ, ເໝາະທີ່ສຸດສຳລັບຜູ້ທີ່ໃສ່ໃຈເລື່ອງຄວາມເປັນສ່ວນຕົວ ແລະ ຜູ້ທີ່ຢາກຮຽນຮູ້ LLM; ຂີດຈຳກັດຄວາມສາມາດແມ່ນຂຶ້ນຢູ່ກັບຮາດແວຂອງທ່ານ ແລະ ໂມເດວ Open Source, ແຕ່ການເຮັດ 4-bit Quantization ຊ່ວຍໃຫ້ແລັບທັອບທົ່ວໄປສາມາດຣັນໄດ້.

ແຫຼ່ງຂໍ້ມູນ

ຮວບຮວມຕາມประกาศທາງການ ແລະ ຂໍ້ມູນສາທາລະນະ, ໂດຍຍຶດຖືຂໍ້ມູນຈາກທາງການເປັນຫຼັກ.

ຄວາມເຂົ້າໃຈຜິດທົ່ວໄປ / ໄຂຂໍ້ຂ້ອງໃຈ

ບາງคนອາດຈະເຂົ້າໃຈຜິດວ່າ ໂມເດວ AI ໃນເຄື່ອງຂອງ Ollama ເປັນເຄື່ອງມືທີ່ "ບໍ່ ຈຳເປັນຕ້ອງໃຊ້ອິນເຕີເນັດເລີຍ", ແຕ່ໃນຄວາມເປັນຈິງແລ້ວ ໃນການດາວໂຫຼດໂມເດວຄັ້ງທຳອິດຍັງຄົງຈຳເປັນຕ້ອງເຊື່ອມຕໍ່ອິນເຕີເນັດ. ນອກຈາກນັ້ນ, ເຖິງແມ່ນວ່າໂມເດວຂອງ Ollama ຈະບໍ່ສົ່ງຂໍ້ມູນຂອງຜູ້ໃຊ້ງານອອກສູ່ພາຍນອກ, ແຕ່ຜູ້ໃຊ້ງານກໍ່ຍັງຈຳເປັນຕ້ອງລະມັດລະວັງເລື່ອງຄວາມປອດໄພພາຍໃນເຄື່ອງ ເຊັ່ນ: ໃຜສາມາດເຂົ້າເຖິງເຄື່ອງນີ້ໄດ້, API ມີການເປີດເຜີຍອອກໄປ ຫລື ບໍ່ ແລະ ບັນຫາອື່ນໆ. ພ້ອມກັນນັ້ນ, ເຖິງວ່າຄວາມສາມາດຂອງ Ollama ຈະບໍ່ດ້ອຍໄປກວ່າໂມເດວເທິງ Cloud ບາງຕົວ, ແຕ່ມັນກໍ່ຍັງຄົງຖືກຈຳກັດດ້ວຍຮາດແວ ແລະ ຄວາມສາມາດຂອງໂມເດວ Open Source.

ການເລືອກໂມເດວທີ່ເໝາະສົມ

ໂມເດວ ຂະໜາດ ຄວາມຕ້ອງການໜ່ວຍຄວາມຈຳ ຮາດແວທີ່ເໝາະສົມ
Qwen3:8b 8B ~16GB ແລັບທັອບທົ່ວໄປ
Q4_K_M (4-bit) 7B ~4GB ຮາດແວສະເປກຕໍ່າລົງມາ
Llama 13B ~32GB ແລັບທັອບສະເປກສູງ ຫຼື ເຊີບເວີ

ການເລືອກໂມເດວທີ່ເໝາະສົມ ຈຳເປັນຕ້ອງຄຳນຶງເຖິງຂໍ້ຈຳກັດຂອງຮາດແວ, ເຊັ່ນ: ໜ່ວຍຄວາມຈຳ ແລະ ຄວາມສາມາດຂອງ GPU. ໂດຍທົ່ວໄປແລ້ວ, ແລັບທັອບທີ່ມີໜ່ວຍຄວາມຈຳ 8GB ສามารถຣັນໂມເດວຂະໜາດ 3B~8B ໄດ້, ສ່ວນແລັບທັອບທີ່ມີໜ່ວຍຄວາມຈຳ 16GB ຂຶ້ນໄປ ຈຶ່ງຈະເໝາະສົມກວ່າໃນການຣັນໂມເດວຂະໜາດ 13B ຂຶ້ນໄປ.

ຂັ້ນຕອນການປະຕິບັດ: ການປັບແຕ່ງໂມເດວຕາມຄວາມຕ້ອງການ

Ollama ມີຟັງຊັນ Modelfile ທີ່ອະນຸຍາດໃຫ້ຜູ້ໃຊ້ສາມາດປັບແຕ່ງຄ່າພາຣາະເເຕີຂອງໂມເດວໄດ້, ເຊັ່ນ: System Prompt, Temperature ແລະ ຄ່າອື່ນໆ. ນີ້ແມ່ນຂັ້ນຕອນໃນການປັບແຕ່ງໂມເດວ:

  1. ຂຽນໄຟລ໌ Modelfile ຂຶ້ນມາ, ຕັ້ງຄ່າພາຣາະເເຕີທີ່ຕ້ອງການ.
  2. ປະຕິບັດຄຳສັ່ງ ollama create, ເພື່ອສ້າງໂມເດວທີ່ປັບແຕ່ງຕາມຄວາມຕ້ອງການ.
  3. ປະຕິບັດຄຳສັ່ງ ollama run, ເเพื่อເລີ່ມຕົ້ນໃຊ້ງານໂມເດວທີ່ປັບແຕ່ງແລ້ວ.

ທ່າອ່ຽງໃນອະນາຄົດ

ດ້ວຍຄວາມກ້າວໜ້າຂອງໂມເດວ Open Source ແລະ ການຍົກລະດັບຮາດແວ, ຄວາມສາມາດຂອງ Ollama ຈະຍິ່ງມີພະລັງຫຼາຍຂຶ້ນເລື້ອຍໆ. ໃນອະນາຄົດ, ອາດຈະມີໂມເດວ ແລະ ຟັງຊັນໃໝ່ໆຖືກເພີ່ມເຂົ້າມາໃນ Ollama ຫຼາຍຂຶ້ນ, ເຊັ່ນ: ການຮອງຮັບແພັດຟອມຮາດແວທີ່ຫຼາກຫຼາຍຂຶ້ນ, ການປັບປຸງຄວາມຖືກຕ້ອງຂອງໂມເດວ ແລະ ອື່ນໆ. ພ້ອມກັນນັ້ນ, ຈຳນວນຜູ້ໃຊ້ງານ Ollama ກໍ່ອາດຈະເພີ່ມຂຶ້ນເລື້ອຍໆ, ໂດຍສະເພາະໃນກຸ່ມອຸດສາຫະກຳທີ່ຕ້ອງການຄວາມປອດໄພຂອງຂໍ້ມູນເປັນພິເສດ ເຊັ່ນ: ວຽກງານກົດໝາຍ, ການແພດ, ການຄົ້ນຄວ້າ ແລະ ພັດທະນາ ເປັນຕົ້ນ.

ຄຳຖາມທີ່ພົບເລື້ອຍ

Ollama ແມ່ນຫຍັງ?

ເຄື່ອງມືທີ່ຊ່ວຍໃຫ້ທ່ານສາມາດຣັນ Large Language Model ໄວ້ໃນຄອມພິວເຕີຂອງທ່ານເອງ ໂດຍມີພື້ນຖານຈາກ llama.cpp, ໃຊ້ Model ໃນຮູບແບບ GGUF ພຽງແຕ່ຕິດຕັ້ງດ້ວຍຄຳສັ່ງດຽວ ແລ້ວໃຊ້ ollama pull / run ເພື່ອດາວໂຫຼດ ແລະ ສົນທະນາໄດ້ເລີຍ.

ວິທີໃຊ້ງານ Ollama ຕ້ອງເຮັດແນວໃດ?

ຫຼັງຈາກຕິດຕັ້ງແລ້ວ ໃຫ້ພິມ ollama pull ເພື່ອດາວໂຫຼດ Model (ເຊັ່ນ: qwen3:8b), ຈາກນັ້ນໃຊ້ ollama run ເພື່ອເລີ່ມສົນທະນາ; ຖ້າຕ້ອງການເຊື່ອມຕໍ່ກັບໂປຣແກຣມ ສາມາດໃຊ້ OpenAI Compatible REST API (localhost:11434) ທີ່ມີມາໃຫ້ໃນຕົວໄດ້ເລີຍ.

ການຣັນ Ollama ຕ້ອງການສະເປກຮາດແວແນວໃດ?

ຂຶ້ນຢູ່ກັບຂະໜາດຂອງ Model: RAM 8GB ສາມາດຣັນ Model ຂະໜາດ 3B ຫາ 8B ໄດ້, RAM 16GB ຂຶ້ນໄປຈະເໝາະກັບ Model 13B ຂຶ້ນໄປ; ຖ້າໃຊ້ການບີບອັດແບບ Q4_K_M 4-bit ຈະຊ່ວຍປະຫຍັດ RAM ໄດ້ປະມານ 75%, Model ຂະໜາດ 7B ຈະໃຊ້ RAM ປະມານ 4GB ເທົ່ານັ້ນ.

Ollama ຕ່າງຈາກ ChatGPT ແນວໃດ?

Ollama ປະມວນຜົນໃນເຄື່ອງ, ຂໍ້ມູນບໍ່ຮົ່ວໄຫຼ, ສามารถນຳໃຊ້ແບບອອບລາຍ ແລະ ບໍ່ເສຍຄ່າສະມາຊິກ, ແຕ່ຄວາມສາມາດຈະຖືກຈຳກັດຕາມຮາດແວ ແລະ Open-source model; ສ່ວນ ChatGPT ແມ່ນ Cloud Model ລະດັບທັອບ, ມີຄວາມສາມາດສູງກວ່າ ແລະ สะดวกกว่า, ແຕ່ຂໍ້ມູນຈະຖືກສົ່ງຂຶ້ນ Cloud.

繁體中文版 →