Tutorial lengkap RunPod: sewa sekeping H100 untuk menjalankan model, kadar sejamnya lebih murah daripada sangkaan anda (disertai harga sebenar setiap kad)

Mahu menjalankan model sumber terbuka tetapi tidak mampu membeli kad grafik? RunPod membolehkan anda menyewa GPU mengikut minit. Artikel ini menghurai perbezaan Pod dengan Serverless, harga sebenar setiap kad, serta tiga tempat yang paling mudah membuatkan anda terlebih belanja.

Tutorial lengkap RunPod: sewa sekeping H100 untuk menjalankan model, kadar sejamnya lebih murah daripada sangkaan anda (disertai harga sebenar setiap kad)

Seorang kawan yang menjadi pembangun bebas di Kuala Lumpur mahu menala halus sebuah model sumber terbuka. Dia pergi menyemak harga kad grafik dahulu, dan selepas melihat sebut harga H100, dia diam-diam menutup tab itu. Kemudian dia bertanya kepada saya: "Ada tak cara guna dua hari sahaja?"

Ada. Dan kos dua hari itu lebih kurang sama dengan makan malam yang agak sedap.

RunPod ialah salah satu platform GPU awan berpatutan yang paling kerap disyorkan beberapa tahun ini. Artikel ini akan menjelaskannya: cara membukanya, jenis mana yang patut dipilih, berapa sebenarnya harga setiap kad, dan tiga tempat yang paling mudah menyebabkan anda terlebih belanja secara tidak sedar.

Apa ini

RunPod menyediakan sumber pengkomputeran GPU dan CPU yang boleh dibuka dan digunakan bila-bila masa, untuk latihan AI, penalaan halus, penjanaan imej dan kerja lain yang banyak makan kuasa pengkomputeran. Kedudukan rasminya ialah memberi anda kawalan penyesuaian penuh terhadap persekitaran pengkomputeran — apa yang anda dapat bukan API yang terhad, tetapi sebuah mesin yang boleh dimasuki melalui SSH.

Ia mempunyai dua mod utama, dan salah pilih akan menyebabkan kos berbeza jauh:

Pods — dapatkan terus sumber GPU/CPU khusus, dengan kawalan penuh terhadap persekitaran. Penjelasan rasminya ialah pengebilan mengikut minit, dan tanpa caj trafik masuk keluar (ingress/egress). Sesuai untuk pembangunan interaktif, latihan dan penalaan halus.

Serverless — lancarkan aplikasi AI/ML tanpa perlu mengkonfigurasi atau menguruskan pelayan sendiri, dengan pengebilan mengikut penggunaan worker yang benar-benar beroperasi dan bukan tempahan mengikut jam. Sesuai untuk perkhidmatan inferens yang trafiknya tidak stabil.

Selain itu ada satu lagi pembezaan penting: Secure Cloud menggunakan pusat data bertaraf T3/T4, sesuai untuk kegunaan perusahaan; Community Cloud ialah sistem rakan ke rakan (peer-to-peer) dengan harga yang lebih berdaya saing. Perbezaannya pada kestabilan dan pematuhan, bukan pada prestasi.

Apa yang boleh dilakukan

  • Menala halus model sumber terbuka: sewa sekeping A100 atau H100 untuk menjalankan penalaan halus LoRA atau parameter penuh selama beberapa jam hingga beberapa hari.
  • Ujian inferens model tempatan: apabila mahu mencuba model 70B parameter tetapi mesin sendiri tidak larat menjalankannya.
  • Penjanaan imej berkelompok: pengeluaran besar-besaran Stable Diffusion atau penjanaan video.
  • Pelaksanaan perkhidmatan inferens: bina satu titik akhir API yang mengembang mengikut permintaan menggunakan Serverless.
  • Eksperimen dan pembelajaran: mahu menyentuh GPU tetapi tidak mahu membelanjakan ratusan ribu untuk membeli perkakasan dahulu.

Cara guna (langkah demi langkah)

Langkah satu: daftar dan tambah nilai

RunPod menggunakan sistem prabayar; tambah nilai dahulu sebelum guna. Kali pertama disyorkan menambah nilai jumlah paling minimum untuk menguji keadaan, jangan tambah terlalu banyak sekali gus.

Langkah dua: pilih Pod atau Serverless

Prinsip penilaiannya sangat mudah:

  • Perlu interaktif, perlu masuk SSH untuk mengubah sesuatu, kerja berjalan berterusan beberapa jam ke atas → Pods
  • Ialah sebuah API yang akan dipanggil, trafik ada kalanya ada kalanya tiada, tidak mahu bayar ketika terbiar → Serverless

Bagi pemula, dalam 90% keadaan patut pilih Pods.

Langkah tiga: pilih GPU dan jenis awan

Inilah langkah dengan perbezaan harga paling besar. Berikut ialah kadar sejam yang diumumkan secara rasmi (Community Cloud/Secure Cloud):

GPU VRAM Community Secure
RTX 4090 24GB $0.34 $0.74
A40 48GB $0.35 $0.44
A100 PCIe 80GB $1.19 $1.39
A100 SXM 80GB $1.39 $1.59
H100 PCIe 80GB $1.99 $2.89
H100 SXM 80GB $2.69 $3.29

Mari kira: menyewa sekeping H100 PCIe menggunakan Community Cloud dan menjalankannya penuh 24 jam, lebih kurang $47.76, iaitu sekitar RM 210. Menjalankannya dua hari kurang daripada RM 450. Inilah sebabnya masalah kawan saya itu ada penyelesaian.

Cadangan praktikal memilih kad: untuk inferens model 7B hingga 13B atau penalaan halus LoRA, 24GB RTX 4090 biasanya sudah cukup, dan ia kad dengan nisbah harga-prestasi paling tinggi. Untuk menjalankan tahap 70B atau penalaan halus parameter penuh, barulah perlu 80GB A100 atau H100. Jangan terus melompat ke H100 dari mula; ramai yang selepas menyewanya mendapati VRAM langsung tidak penuh diguna.

Langkah empat: pilih templat atau kontena tersuai

RunPod menyediakan templat prabina (PyTorch, TensorFlow, pelbagai WebUI), dan boleh juga menentukan imej kontena sendiri. Bagi pemula, terus guna templat PyTorch rasmi paling mudah.

Langkah lima: tetapkan storan

Langkah inilah yang paling ramai abaikan, dan juga paling mudah membuatkan anda terlebih belanja. Caj storan seperti berikut:

  • Container Disk: $0.10 setiap GB sebulan
  • Volume Disk (semasa beroperasi): $0.10 setiap GB sebulan
  • Network Storage versi standard: bawah 1TB $0.07 setiap GB sebulan, atas 1TB $0.05
  • Network Storage versi berprestasi tinggi: $0.14 setiap GB sebulan

Network Volume ialah storan berterusan yang wujud secara berasingan daripada sumber pengkomputeran, dan boleh dilekapkan pada pelbagai Pod atau titik akhir Serverless untuk berkongsi data. Fungsi ini sangat kritikal — letakkan pemberat model dan set data pada Network Volume, dan anda boleh mematikan Pod (henti pengebilan GPU) tanpa perlu memuat turun semula model berpuluh GB setiap kali.

Langkah enam: sambung dan mula bekerja

Selepas Pod berjalan, ia boleh disambung melalui SSH, JupyterLab, VS Code atau proksi web, bergantung pada corak kerja anda.

Teknik lanjutan

Manfaatkan Network Volume untuk memisahkan pengkomputeran dan data. Inilah tip menjimatkan wang yang paling penting. GPU ialah benda mahal yang dibil mengikut minit, manakala storan ialah benda murah beberapa dolar sebulan. Letakkan data pada Volume, dan buka Pod hanya bila perlu; sepanjang selang di tengah anda langsung tidak membayar wang GPU.

Cuba Community Cloud dahulu, naik Secure Cloud kemudian. Pada peringkat pembangunan dan eksperimen gunakan Community Cloud; beza harga RTX 4090 melebihi satu kali ganda. Apabila hendak menjalankan kerja rasmi atau yang mempunyai keperluan pematuhan barulah tukar ke Secure Cloud.

Untuk penggunaan jangka panjang lihat Savings Plan. Secara rasmi disediakan pelan penjimatan untuk penggunaan jangka panjang; jika anda pasti akan menjalankannya beberapa minggu berturut-turut, berbaloi dikira.

Fahami logik pengebilan Serverless. Kadar Serverless lebih tinggi daripada Pod (contohnya A100 80GB $2.72 sejam, H100 80GB $4.79, RTX 4090 $1.10), tetapi ia hanya dibil ketika worker benar-benar beroperasi. Ketika trafik jarang jumlah kosnya lebih rendah, ketika trafik padat ia sebaliknya lebih mahal daripada Pod. Kira kadar penggunaan sebenar anda dahulu barulah tentukan.

Perkara yang perlu diberi perhatian

Lupa mematikan Pod ialah kesilapan paling mahal. Maksud pengebilan mengikut minit ialah lapan jam ketika anda tidur pun ia terus dibil. Sekeping H100 yang terlupa dimatikan selama satu hujung minggu, bilnya lebih kurang $60. Pupuk tabiat berhenti sebaik selesai guna, atau tetapkan amaran belanjawan.

Mesin Community Cloud mungkin ditarik semula. Ini sifat sistem rakan ke rakan, dan kestabilannya tidak sebaik Secure Cloud. Kerja latihan berjangka panjang wajib membuat checkpoint dengan baik; jangan berjalan sehingga jam kesepuluh barulah mendapati mesin sudah hilang.

VRAM bukan satu-satunya halangan. Memori sistem, I/O cakera dan lebar jalur rangkaian semuanya boleh menjadi kekangan. Memuat turun pemberat model 140GB juga mengambil masa, dan pada tempoh itu GPU berpusing kosong sambil dibil.

Harga akan berubah. Angka di atas ialah kadar yang diumumkan secara rasmi ketika artikel ini ditulis; harga awan GPU berayun agak besar, jadi wajib sahkan di laman rasmi sebelum membuat pesanan sebenar.

Komen TheAI Academy

Saya rasa nilai sebenar RunPod bukan pada murahnya, tetapi pada cara ia menurunkan kos "cuba dahulu" hampir kepada sifar.

Dahulu, untuk mengesahkan sama ada sesuatu idea perlu menggunakan model besar, anda perlu memujuk bos membeli kad, atau beratur menunggu sumber GPU syarikat. Kini anda membelanjakan tiga dolar untuk berjalan tiga jam sudah tahu jawapannya. Perubahan ini amat penting bagi pembangun bebas dan pasukan kecil di Malaysia — kita tiada belanjawan kuasa pengkomputeran berjuta-juta, dan yang kita harapkan ialah membelanjakan setiap ringgit pada tempat yang tepat.

Tetapi kita perlu jujur tentang kelemahannya. Kestabilan Community Cloud memang tidak sebaik awan syarikat besar; keadaan mesin ditarik semula dan kualiti nod yang tidak seragam memang wujud. Kedudukannya ialah "pilihan berciri harga-prestasi tinggi untuk pembangunan dan eksperimen", bukan "tempat menjalankan perkhidmatan kritikal persekitaran pengeluaran". Perjelaskan perkara ini, maka anda tidak akan mempunyai jangkaan yang salah.

Komen: RunPod ialah pintu masuk GPU yang paling praktikal bagi pembangun bebas dan pasukan kecil di Malaysia. Ingat dua perkara maka anda dapat menjimatkan sebahagian besar wang yang sia-sia — gunakan Network Volume untuk memisahkan data dengan pengkomputeran, dan ingat matikan sebaik selesai guna.

Cadangan konkrit untuk pembaca di Malaysia: kali pertama guna, tambah nilai jumlah minimum dahulu, buka sekeping Pod RTX 4090 Community Cloud, dan jalankan satu tugasan kecil yang anda biasa untuk melancarkan aliran kerja. Setelah pasti anda akan mematikan Pod dan akan menggunakan Volume, barulah pertimbangkan membuka kad yang lebih mahal. Perlu diingatkan juga, kependaman sambungan rentas negara terasa pada pembangunan interaktif; untuk kerja berjangka panjang disyorkan menggunakan tmux atau screen bagi mengelakkan gangguan putus sambungan. Untuk memadankannya dengan pangkalan data vektor bagi RAG, lihat Tutorial Qdrant kami; lebih banyak alat awan dan infrastruktur ada dalam kategori Rangka Kerja Pembangunan AI dan Infrastruktur.

Sumber rujukan

(Artikel ini disusun berdasarkan maklumat awam rasmi; harga dan spesifikasi adalah tertakluk pada pengumuman terkini laman rasmi.)

Soalan Lazim

Pods atau Serverless, yang mana patut dipilih?

Jika perlu interaktif, perlu masuk SSH untuk mengendalikannya, dan kerja berjalan berterusan beberapa jam ke atas, pilih Pods; jika ialah API yang akan dipanggil, trafik ada kalanya ada kalanya tiada, dan tidak mahu bayar ketika terbiar, pilih Serverless. Bagi pemula, 90% keadaan patut guna Pods. Kadar unit Serverless lebih tinggi, tetapi hanya dibil ketika worker benar-benar beroperasi.

Apa bezanya Community Cloud dengan Secure Cloud?

Secure Cloud menggunakan pusat data bertaraf T3/T4, dengan kestabilan dan pematuhan yang lebih baik; Community Cloud ialah sistem rakan ke rakan, harganya lebih murah tetapi mesin mungkin ditarik semula. Ambil RTX 4090 sebagai contoh: Community $0.34 sejam, Secure $0.74. Guna Community untuk eksperimen pembangunan, Secure untuk kerja rasmi atau yang mempunyai keperluan pematuhan.

Bagaimana mengelakkan bil melambung?

Yang paling penting ialah berhenti Pod sebaik selesai guna — pengebilan mengikut minit bermakna ketika anda tidur pun ia terus dibil, dan sekeping H100 yang terlupa dimatikan selama satu hujung minggu berjumlah lebih kurang $60. Selain itu, letakkan model dan set data pada Network Volume supaya anda boleh mematikan Pod tanpa perlu memuat turun semula setiap kali; caj storan hanya $0.05 hingga $0.10 setiap GB sebulan.

Adakah menjalankan model 7B memerlukan sewa H100?

Tidak perlu. Untuk inferens atau penalaan halus LoRA 7B hingga 13B, 24GB VRAM RTX 4090 biasanya sudah mencukupi, dan ia kad dengan nisbah harga-prestasi paling tinggi (Community $0.34 sejam). Untuk menjalankan tahap 70B atau penalaan halus parameter penuh barulah perlu 80GB A100/H100. Ramai yang menyewa H100 tetapi mendapati VRAM langsung tidak penuh diguna.

繁體中文版 →