មគ្គុទេសក៍ការប្រើប្រាស់ Ollama៖ ការចាប់ផ្តើមដំណើរការម៉ូឌែល AI ក្នុងមូលដ្ឋានលើកុំព្យូទ័ររបស់អ្នក

Ollama ធ្វើឱ្យការដំណើរការម៉ូឌែលភាសាខ្នាតធំក្នុងមូលដ្ឋាន មានភាពងាយស្រួលដោយគ្រាន់តែប្រើប្រាស់ពាក្យបញ្ជាបន្តិចបន្តួច និងធានាថាទិន្នន័យស្ថិតនៅលើម៉ាស៊ីនរបស់អ្នកទាំងស្រុង។ អត្ថបទនេះនឹងបង្ហាញអ្នកពីវិធីសាស្ត្រដំឡើង ទាញយកម៉ូឌែល ការប្រើប្រាស់កម្រិតបរិមាណ (Quantization) ដើម្បីសន្សំសំចៃអង្គចងចាំ និងការតភ្ជាប់ API។

רץ AI 模型​លើកុំព្យូទ័រយួរដៃផ្ទាល់ខ្លួនរបស់អ្នកដោយមិនចាំបាច់ប្រើប្រាស់ Cloud

Ollama ដោះស្រាយបញ្ហាជាក់ស្តែងមួយ ដែលនោះគឺ៖ "ខ្ញុំចង់ប្រើប្រាស់គំរូភាសាខ្នាតធំ (LLM) ប៉ុន្តែមិនចង់បញ្ជូនទិន្នន័យរបស់ខ្ញុំទៅកាន់ Cloud របស់ผู้อទៃឡើយ"។ វាបានបង្រួមការដំណើរការ LLM ក្នុងមូលដ្ឋាន (Local) ដែលពីមុនមានភាពស្មុគស្មាញ ឱ្យទៅជាពាក្យបញ្ជា (Command) ត្រឹមតែប៉ុន្មានជួរប៉ុណ្ណោះ៖ ការដំឡើង, ollama pull ដើម្បីទាញយក Model, និង ollama run ដើម្បីចាប់ផ្តើមជជែកគ្នា រួចជាស្រេច។ បច្ចេកវិទ្យាខាងក្រោមគឺ llama.cpp ដោយ Model ប្រើប្រាស់ទ្រង់ទ្រាយ GGUF ហើយ Metal របស់ Mac, CUDA របស់ NVIDIA និង Vulkan ឥឡូវនេះសុទ្ធតែអាចប្រើប្រាស់ឯកសារប្រភេទដូចគ្នា។ ពេលដែលខ្ញុំដំណើរការនៅលើ MacBook ផ្ទាល់ខ្លួន គឺមានភាពងាយស្រួលជាងដំណើរការជំហានដែលត្រូវ ಕಂಪાઇલ (Compile) អ្វីៗជាច្រើនកាលពីពីរឆ្នាំមុនទៅទៀត។

តើ Ollama អាចធ្វើអ្វីបានខ្លះ?

  • ដំឡើងដោយប្រើពាក្យបញ្ជាត្រឹមតែមួយជួរ ដែលវាដំណើរការដោយស្វ័យប្រវត្តិទាំងការទាញយក Model ការរកឃើញ GPU និងសេវាកម្ម API
  • គ្រាន់តែប្រើ ollama pull / ollama run ក៏អាចទាញយក និងចាប់ផ្តើមជជែកបានភ្លាមៗ ដោយផ្អែកលើ CLI ជាចម្បង
  • មានបណ្តុំ Model มากกว่า 100 ប្រភេទ (Llama, Qwen, Gemma, DeepSeek ជាដើម)
  • មានភ្ជាប់មកជាមួយនូវ REST API ស្រាប់ និងអាចប្រើប្រាស់ร่วมกันได้ជាមួយទម្រង់ OpenAI ធ្វើឱ្យងាយស្រួលក្នុងការតភ្ជាប់ទៅកាន់កម្មវិធីផ្ទាល់ខ្លួន
  • ប្រើប្រាស់ Modelfile ដើម្បីប្ដូរតាមបំណងនូវប៉ារ៉ាម៉ែត្ររបស់ Model (ប្រៀបដូចជា Dockerfile សម្រាប់ LLM)
  • គាំទ្រ Docker ដោយទិន្នន័យទាំងអស់នៅរក្សាទុកក្នុងម៉ាស៊ីនមូលដ្ឋាន (Local) និងមិនបែកធ្លាយចេញក្រៅឡើយ

វិធីចាប់ផ្តើមប្រើប្រាស់ (ជំហាននានា)

  1. ចូលទៅកាន់គេហទំព័រផ្លូវការដើម្បីទាញយក និងដំឡើង Ollama (មានសម្រាប់ macOS / Windows / Linux)
  2. เปิด Terminal แล้วพิมพ์ ollama pull qwen3:8b ដើម្បីទាញយក Model មួយ (កម្រិត 8B គឺស័ក្តិសមសម្រាប់កុំព្យូទ័រយួរដៃទូទៅក្នុងការចាប់ផ្តើម)
  3. វាយបញ្ចូល ollama run qwen3:8b រង់ចាំវាផ្ទុកទិន្នន័យរួច នោះអ្នកអាចជជែកគ្នាដោយផ្ទាល់នៅក្នុង Terminal បានហើយ
  4. ប្រសិនបើចង់តភ្ជាប់ទៅកាន់កម្មវិធី សូមបើក API ដែលមានស្រាប់ (លំនាំដើម http://localhost:11434) ហើយហៅប្រើប្រាស់ដោយយោងតាមទម្រង់ OpenAI
  5. ប្រសិនបើចង់កែច្នៃតាមបំណង សូមសរសេរឯកសារ Modelfile មួយ កំណត់ System Prompt ប៉ារ៉ាម៉ែត្រ Temperature ជាដើម រួចបន្តជាមួយคำสั่ง ollama create

តិចនិកកម្រិតខ្ពស់

  • ប្រសិនបើអង្គចងចាំ (RAM) មិនគ្រាន់ទេ សូមជ្រើសរើសកំណែ Quantized៖ Q4_K_M (4-bit) សន្សំសំចៃអង្គចងចាំបានប្រហែល 75% ដោយ Model 7B ធ្លាក់ចុះពី ~16GB មកនៅត្រឹម ~4GB ខណៈដែលគុណភាពធ្លាក់ចុះតិចតួចបំផុត
  • ទំហំ Model ត្រូវតែត្រូវគ្នាទៅនឹងផ្នែករឹង (Hardware):អង្គចងចាំ 8GB អាចដំណើរការ Model ទំហំ 3B~8B រីឯអង្គចងចាំចាប់ពី 16GB ឡើងទៅទើបអាចដំណើរការ Model ទំហំ 13B ឡើងទៅបានយ៉ាងរលូន
  • ឯកសារ GGUF ដែលទាញយកពី Hugging Face អាចត្រូវបានนำเข้า (Import) តាមរយៈ Modelfile ដោយមិនកំណត់ត្រឹមតែបណ្តុំផ្លូវការនោះទេ
  • ប្រសិនបើអ្នកចង់បានចំណុចប្រទាក់ក្រាហ្វិក (GUI) អ្នកអាចប្រើរួមគ្នាជាមួយ LM Studio ឬ Front-end UI ដែលមានភាពរួសរាយរាក់ទាក់ខ្លាំងសម្រាប់អ្នកដែលមិនសاوសភាពជាមួយ CLI
  • ការតភ្ជាប់ Endpoint ដែលត្រូវគ្នាជាមួយ OpenAI របស់ Ollama ទៅក្នុងកម្មវិធីដែលមានស្រាប់របស់អ្នក គឺแทบจะไม่ต้องแก้ SDK

រឿងដែលត្រូវយកចិត្តទុកដាក់

  • សមត្ថភាពរបស់ Model ក្នុងមូលដ្ឋាន (Local) ជាទូទៅមិនអាចប្រៀបធៀបទៅនឹង Model លើ Cloud កម្រិតខ្ពស់ដូចជា GPT ឬ Claude នោះឡើយ ដូច្នេះសូមកុំរំពឹងថានឹងមានលទ្ធផលដូចគ្នាបេះបិទ
  • ប្រើប្រាស់ Hardware ខ្លាំង៖ ប្រសិនបើគ្មានកាតក្រាហ្វិកដាច់ដោយឡែក (Dedicated GPU) ឬមានអង្គចងចាំតិច Model ធំៗនឹងដំណើរការយឺតខ្លាំង ឬសូម្បីតែដំណើរការមិនរួច
  • ការទាញយក Model លើកដំបូងអាចមានទំហំរាប់ GB ដូច្នេះសូមយកចិត្តទុកដាក់លើបណ្តាញអ៊ីនធឺណិត និងទំហំថាសរឹង (Disk Space)
  • ទោះបីជាទិន្នន័យមិនបែកធ្លាយចេញក្រៅក៏ដោយ ក៏សុវត្ថិភាពក្នុងម៉ាស៊ីនមូលដ្ឋាន (អ្នកណាអាចចូលប្រើប្រាស់ម៉ាស៊ីននេះ API មានការបែកធ្លាយឬអត់) គឺអ្នកត្រូវតែមើលថែរក្សាដោយខ្លួនឯង

ការសន្និដ្ឋាន និងការវាយតម្លៃពី TheAI學院

និយាយតាមត្រង់ទៅ Ollama គឺជាเครื่องมือ ທີ່ខ្ញុំនឹងណែនាំដោយផ្ទាល់ដល់មនុស្សពីរប្រភេទគឺ៖ អ្នកដែល "យកចិត្តទុកដាក់លើភាពឯកជន" និងអ្នកដែល "ចង់ស្វែងយល់ពីរបៀបដែល LLM ដំណើរការ"។ សម្រាប់វិស័យច្បាប់ វេជ្ជសាស្ត្រ និងការស្រាវជ្រាវ និងអភិវឌ្ឍន៍ ដែលជាកន្លែងមិនអាចបញ្ជូនទិន្នន័យចេញទៅក្រៅបាន Model ក្នុងមូលដ្ឋានគឺជាដំណោះស្រាយដ៏កម្រមួយ; រីឯសម្រាប់អ្នកអភិវឌ្ឍន៍ វាបានកាត់បន្ថយថ្លៃដើមនៃការពិសោធន៍រហូតដល់ស្ទើរតែសូន្យ —— ចង់ប່ຽស Model គ្រាន់តែ pull មួយមក ចង់តភ្ជាប់ API គ្រាន់តែប្រើ OpenAI-compatible endpoint โดยแทบไม่ต้องแก้โค้ด។ ដែនកំណត់របស់វាគឺអាស្រ័យលើ Hardware របស់អ្នក និងសមត្ថភាពរបស់ Model បើកចំហ (Open-source) ក្នុងរយៈពេលពីរឆ្នាំនេះ Model បើកចំហមានការរីកចម្រើនយ៉ាងឆាប់រហ័ស ហើយការทำ Quantization แบบ 4-bit ក៏បានធ្វើឱ្យកុំព្យូទ័រយួរដៃទូទៅអាចដំណើរការបានផងដែរ ផ្លូវនេះនឹងកាន់តែទូលំទូលាយឡើងៗ។ ប្រសិនបើអ្នកគ្រាន់តែត្រូវការការជជែកកំសាន្តដ៏ងាយស្រួល ChatGPT និង Claude នៅលើ Cloud នៅតែជាជម្រើសដ៏ងាយស្រួលជាង; ប៉ុន្តែដរាបណាបន្ទាត់ក្រហម "ទិន្នន័យមិនអាចបែកធ្លាយចេញក្រៅ" ត្រូវបានគូសឡើង Ollama គឺคุ้มค่าที่คุณនឹងចំណាយពេលមួយរសៀលដើម្បីដំឡើង និងលេងវា។ ការអានបន្ថែម៖ មគ្គុទ្ទេសក៍ជាក់ស្តែងស្តីពីភាពឯកជន និងសុវត្ថិភាព AI, របៀបប្រើប្រាស់ LM Studio

ការវាយតម្លៃក្នុងប្រយោគតែមួយ៖ Ollama ប្រែក្លាយការដំណើរការ LLM ក្នុងមូលដ្ឋានទៅជាពាក្យបញ្ជាត្រឹមតែប៉ុន្មានជួរប៉ុណ្ណោះ ដែលស័ក្តិសមបំផុតសម្រាប់អ្នកដែលយកចិត្តទុកដាក់លើភាពឯកជន និងអ្នកដែលចង់រៀនអំពី LLM; ដែនកំណត់នៃសមត្ថភាពគឺអាស្រ័យលើ Hardware និង Open-source model របស់អ្នក ប៉ុន្តែការทำ Quantization แบบ 4-bit ធ្វើឱ្យកុំព្យូទ័រយួរដៃទូទៅអាចដំណើរការវាได้។

ប្រភពទិន្នន័យ

ចងក្រងឡើងដោយយោងតាមសេចក្តីប្រកាសផ្លូវការ និងទិន្នន័យសាធារណៈ ដោយយកព័ត៌មានផ្លូវការជាគោល។

ការយល់ច្រឡំទូទៅ / ការបំបាត់ជំនឿខុសឆ្គង

មនុស្សមួយចំនួនប្រហែលជាយល់ច្រឡំថា Model AI ក្នុងមូលដ្ឋានរបស់ Ollama គឺជាเครื่องมือ ທີ່ "មិនចាំបាច់ប្រើប្រាស់អ៊ីនធឺណិតទាំងស្រុង" ប៉ុន្តែការពិតទៅ នៅពេលទាញយក Model ជាលើកដំបូង គឺនៅតែត្រូវការការតភ្ជាប់បណ្តាញអ៊ីនធឺណិត។ លើសពីនេះ ទោះបីជា Model របស់ Ollama មិនបញ្ជូនទិន្នន័យរបស់អ្នកប្រើប្រាស់ចេញទៅក្រៅក៏ដោយ ក៏អ្នកប្រើប្រាស់នៅតែត្រូវយកចិត្តទុកដាក់លើសុវត្ថិភាពក្នុងម៉ាស៊ីនមូលដ្ឋាន ដូចជាអ្នកណាអាចចូលប្រើប្រាស់ម៉ាស៊ីននេះបាន និងថាតើ API មានការបែកធ្លាយឬអត់ជាដើម។ ទន្ទឹមនឹងนี้ 虽说សមត្ថភាពរបស់ Ollama មិនអន់ជាង Model លើ Cloud บางตัวនោះទេ ប៉ុន្តែវាក៏នៅតែត្រូវបានកំណត់ដោយ Hardware និងសមត្ថភាពរបស់ Open-source model ផងដែរ។

การเลือก Model ที่เหมาะสม

Model កម្រិត (Scale) តម្រូវការអង្គចងចាំ (RAM) Hardware ที่เหมาะสม
Qwen3:8b 8B ~16GB កុំព្យូទ័រយួរដៃទូទៅ
Q4_K_M (4-bit) 7B ~4GB Hardware កម្រិតទាបបន្តិច
Llama 13B ~32GB កុំព្យូទ័រយួរដៃកម្រិតខ្ពស់ ឬ Server

ការជ្រើសរើស Model ที่เหมาะสม តម្រូវឱ្យពិចារណាលើកម្រិតកំណត់នៃ Hardware ផងដែរ ដូចជាសមត្ថភាពរបស់ RAM និង GPU เป็นต้น ជាទូទៅ កុំព្យូទ័រយួរដៃដែលមាន RAM 8GB អាចដំណើរការ Model ទំហំ 3B ~ 8B រីឯ RAM ចាប់ពី 16GB ឡើងទៅ ទើបកាន់តែស័ក្តិសមក្នុងការដំណើរការ Model ទំហំ 13B ឡើងទៅ។

ជំហានជាក់ស្តែង៖ การปรับแต่ง Model ตามต้องการ

Ollama ផ្តល់នូវមុខងារ Modelfile ซึ่งอนุญาตให้ผู้ใช้ปรับแต่งพารามิเตอร์ของ Model ได้ ตามต้องการ ដូចជា System Prompt និង Temperature เป็นต้น ខាងក្រោមនេះគឺជាជំហានក្នុងការปรับแต่ง Model:

  1. សរសេរឯកសារ Modelfile មួយ និងកំណត់ប៉ារ៉ាម៉ែត្រដែលត្រូវការ។
  2. ដំណើរការពាក្យបញ្ជា ollama create เพื่อสร้าง Model ที่ปรับแต่งตามต้องการ។
  3. ដំណើរការពាក្យបញ្ជា ollama run เพื่อเริ่มต้นใช้งาน Model ที่ปรับแต่ง។

แนวโน้มในอนาคต

ជាមួយនឹងការរីកចម្រើននៃ Open-source model និងការ nâng cấp hardware នោះសមត្ថភាពរបស់ Ollama នឹងកាន់តែខ្លាំងក្លាឡើង។ នៅពេលអនាគត អាចនឹងមាន Model និងមុខងារជាច្រើនទៀតត្រូវបានបន្ថែមចូលទៅក្នុង Ollama ដូចជាការគាំទ្រដល់វេទិកា Hardware កាន់តែច្រើន ការปรับปรุงความแม่นยำของ model เป็นต้น ទន្ទឹមនឹងនេះ ចំនួនអ្នកប្រើប្រាស់ Ollama ក៏អាចនឹងមានការកើនឡើងផងដែរ ដោយเฉพาะ trong វិស័យที่ទាមទារភាព ரក្សាความลับ ដូចជាវិស័យច្បាប់ វេជ្ជសាស្ត្រ និងការស្រាវជ្រាវ និងអភិវឌ្ឍន៍เป็นต้น។

សំណួរញឹកញាប់

តើ Ollama ជាអ្វី?

វាជាឧបករណ៍ដែលអនុញ្ញាតឱ្យអ្នកដំណើរការម៉ូឌែលភាសាខ្នាតធំក្នុងមូលដ្ឋាននៅលើកុំព្យូទ័រផ្ទាល់ខ្លួនរបស់អ្នក ដោយមានប្រព័ន្ធគោលក្រោមជា llama.cpp និងប្រើប្រាស់ទម្រង់ GGUF សម្រាប់ម៉ូឌែល។ អ្នកគ្រាន់តែប្រើពាក្យបញ្ជាមួយជួរដើម្បីដំឡើង ហើយប្រើប្រាស់ ollama pull/run ដើម្បីទាញយក និងចាប់ផ្តើមសន្ទនា។

តើត្រូវប្រើប្រាស់ Ollama យ៉ាងដូចម្តេច?

បន្ទាប់ពីដំឡើងរួច សូមវាយបញ្ចូល ollama pull ដើម្បីទាញយកម៉ូឌែល (ឧទាហរណ៍ qwen3:8b) ហើយប្រើប្រាស់ ollama run ដើម្បីចាប់ផ្តើមសន្ទនា។ ប្រសិនបើអ្នកចង់តភ្ជាប់ទៅកាន់កម្មវិធីផ្សេង អ្នកអាចប្រើប្រាស់ OpenAI-compatible REST API ដែលមានស្រាប់ (localhost:11434)។

តើការដំណើរការ Ollama ត្រូវការ hardware បែបណា?

វាអាស្រ័យលើទំហំរបស់ម៉ូឌែល៖ អង្គចងចាំទំហំ 8GB អាចដំណើរការម៉ូឌែលទំហំ 3B ដល់ 8B រីឯ 16GB ឡើងទៅគឺសាកសមជាងសម្រាប់ម៉ូឌែល 13B ឡើងទៅ។ ការប្រើប្រាស់កម្រិតបរិមាណ 4-bit ប្រភេទ Q4_K_M អាចជួយសន្សំសំចៃអង្គចងចាំបានប្រហែល 75% ដោយម៉ូឌែលទំហំ 7B ត្រូវការអង្គចងចាំត្រឹមតែប្រហែល 4GB ប៉ុណ្ណោះ។

តើ Ollama មានភាពខុសគ្នាអ្វីខ្លះពី ChatGPT?

Ollama ដំណើរការនៅលើម៉ាស៊ីនផ្ទាល់ខ្លួន ទិន្នន័យមិនធ្លាយចេញក្រៅ អាចប្រើប្រាស់ដោយគ្មានអ៊ីនធឺណិត និងមិនបាច់បង់ប្រាក់ជាវប្រចាំខែ ប៉ុន្តែសមត្ថភាពរបស់វាត្រូវកំណត់ដោយ Hardware និងម៉ូឌែលបែប Open-source។ ចំណែកឯ ChatGPT ជាម៉ូឌែលកម្រិតខ្ពស់លើប្រព័ន្ធ Cloud ដែលមានភាពខ្លាំង និងងាយស្រួលជាង ប៉ុន្តែទិន្នន័យនឹងត្រូវបញ្ជូនឡើងទៅលើ Cloud។

繁體中文版 →