Panduan Lengkap RunPod: Sewa GPU H100 untuk Menjalankan Model, Biaya Per Jam Lebih Murah dari yang Anda Pikirkan (Termasuk Harga Aktual Setiap GPU)

Ingin menjalankan model open-source tapi tidak mampu membeli GPU? RunPod memungkinkan Anda menyewa GPU per menit. Artikel ini membahas perbedaan antara Pod dan Serverless, harga aktual setiap GPU, serta tiga area yang paling mudah membuat Anda menghabiskan lebih banyak uang.

RunPod Panduan Lengkap: Sewa H100 untuk Jalankan Model, Biaya per Jam Lebih Murah dari yang Anda Bayangkan (Sertakan Harga Aktual Setiap Kartu)

Seorang teman yang bekerja sebagai pengembang independen di Taipei ingin melakukan fine‑tuning pada sebuah model open‑source. Ia mengecek harga GPU, melihat penawaran H100, lalu menutup tab tersebut. Lalu ia bertanya kepada saya, “Apakah ada cara hanya pakai dua hari?”

Ada. Dan biaya dua hari itu kira‑kira setara dengan makan malam yang cukup bagus.

RunPod adalah salah satu platform cloud GPU berbiaya terjangkau yang paling sering direkomendasikan dalam beberapa tahun terakhir. Artikel ini akan menjelaskan semuanya: cara memulai, pilihan yang ada, harga tiap kartu secara nyata, serta tiga tempat paling mudah membuat Anda mengeluarkan uang lebih.

Apa Itu

RunPod menyediakan sumber daya GPU dan CPU yang dapat dipakai kapan saja, untuk pelatihan AI, fine‑tuning, rendering, dan pekerjaan berat lainnya. Posisi resmi mereka adalah memberi Anda kontrol penuh atas lingkungan komputasi—bukan sekadar API terbatas, melainkan sebuah mesin yang dapat Anda SSH‑kan.

Ada dua mode utama, dan memilih yang salah dapat membuat biaya melambung:

Pods — Anda langsung mendapatkan sumber daya GPU/CPU khusus, dengan kontrol penuh atas lingkungan. Penagihan per menit, tanpa biaya masuk/keluar data (ingress/egress). Cocok untuk pengembangan interaktif, pelatihan, dan fine‑tuning.

Serverless — Menyebarkan aplikasi AI/ML tanpa harus mengatur atau mengelola server, penagihan berdasarkan penggunaan worker aktual, bukan per jam yang dipesan. Cocok untuk layanan inferensi dengan trafik tidak menentu.

Ada pula pembagian penting: Secure Cloud menggunakan pusat data kelas T3/T4, cocok untuk kebutuhan perusahaan; Community Cloud adalah sistem peer‑to‑peer dengan harga lebih kompetitif. Perbedaannya terletak pada stabilitas dan kepatuhan, bukan pada performa.

Apa Saja yang Bisa Dilakukan

  • Fine‑tuning model open‑source: Sewa A100 atau H100 selama beberapa jam hingga beberapa hari untuk LoRA atau fine‑tuning full‑parameter.
  • Uji inferensi model lokal: Ketika model 70B tidak dapat dijalankan di mesin pribadi.
  • Batch rendering: Produksi massal gambar Stable Diffusion atau video.
  • Deploy layanan inferensi: Pakai Serverless untuk API yang dapat menskalakan secara dinamis.
  • Eksperimen & belajar: Ingin mencoba GPU tanpa harus membeli perangkat keras senilai ratusan ribu.

Cara Menggunakan (Langkah‑Langkah)

Langkah 1: Daftar dan Top‑up

RunPod menggunakan sistem prepaid, jadi Anda harus mengisi saldo dulu sebelum memakai. Untuk percobaan pertama, isi dengan jumlah minimum dulu, jangan langsung top‑up banyak.

Langkah 2: Pilih Pods atau Serverless

Kriteria pilihannya sederhana:

  • Butuh interaksi, SSH untuk ubah‑ubah, pekerjaan berjalan berjam‑jam → Pods
  • Hanya API yang dipanggil, trafik kadang ada kadang tidak, tidak mau bayar saat idle → Serverless

Untuk pemula, 90 % kasus sebaiknya pilih Pods.

Langkah 3: Pilih GPU dan Tipe Cloud

Inilah langkah yang paling memengaruhi harga. Berikut tarif per jam resmi (Community Cloud / Secure Cloud):

GPU VRAM Community Secure
RTX 4090 24GB $0.34 $0.74
A40 48GB $0.35 $0.44
A100 PCIe 80GB $1.19 $1.39
A100 SXM 80GB $1.39 $1.59
H100 PCIe 80GB $1.99 $2.89
H100 SXM 80GB $2.69 $3.29

Contoh perhitungan: menyewa H100 PCIe di Community Cloud selama 24 jam biaya sekitar $47.76, atau kira‑kira Rp1.5 juta. Dua hari kurang dari Rp3.5 juta. Jadi pertanyaan teman saya memang ada solusinya.

Saran praktis pemilihan kartu: untuk inferensi atau LoRA model 7B‑13B, RTX 4090 dengan 24 GB biasanya cukup dan paling cost‑effective. Untuk model 70B atau fine‑tuning full‑parameter, baru diperlukan A100 atau H100 dengan 80 GB. Jangan buru‑buru pilih H100; banyak orang menyewa dan ternyata VRAM tidak terpakai penuh.

Langkah 4: Pilih Template atau Kontainer Kustom

RunPod menyediakan template siap pakai (PyTorch, TensorFlow, berbagai WebUI), serta opsi untuk memakai image kontainer Anda sendiri. Pemula sebaiknya pakai template PyTorch resmi untuk mempermudah.

Langkah 5: Atur Penyimpanan

Ini adalah bagian yang paling sering diabaikan dan paling mudah bikin biaya membengkak. Tarif penyimpanan:

  • Container Disk: $0.10 per GB per bulan
  • Volume Disk (saat berjalan): $0.10 per GB per bulan
  • Network Storage standar: <1 TB $0.07 per GB per bulan, >1 TB $0.05 per GB per bulan
  • Network Storage high‑performance: $0.14 per GB per bulan

Network Volume adalah penyimpanan persisten yang terpisah dari sumber daya komputasi, dapat dipasang ke banyak Pod atau endpoint Serverless untuk berbagi data. Fitur ini krusial—letakkan bobot model dan dataset di Network Volume, lalu matikan Pod (hentikan penagihan GPU) tanpa harus mengunduh ulang model berpuluh‑puluh GB setiap kali.

Langkah 6: Sambungkan & Mulai Bekerja

Setelah Pod aktif, Anda dapat masuk lewat SSH, JupyterLab, VS Code, atau proxy web, tergantung preferensi kerja Anda.

Tips Lanjutan

Manfaatkan Network Volume untuk memisahkan komputasi dan data. Ini adalah trik hemat biaya paling penting. GPU dihitung per menit (mahal), sedangkan penyimpanan hanya beberapa dolar per bulan (murah). Simpan data di Volume, hidupkan Pod hanya saat diperlukan; saat idle tidak ada biaya GPU sama sekali.

Coba dulu di Community Cloud, pindah ke Secure Cloud bila diperlukan. Pada fase pengembangan dan eksperimen, gunakan Community Cloud; perbedaan harga RTX 4090 lebih dari dua kali lipat. Beralih ke Secure Cloud ketika harus menjalankan pekerjaan produksi atau yang memerlukan kepatuhan.

Pertimbangkan Savings Plan untuk penggunaan jangka panjang. RunPod menawarkan paket penghematan bagi yang yakin akan memakai sumber daya selama beberapa minggu berturut‑turut.

Pahami logika penagihan Serverless. Tarif Serverless lebih tinggi per jam (misalnya A100 80 GB $2.72/jam, H100 80 GB $4.79/jam, RTX 4090 $1.10/jam), namun hanya dibayar saat worker benar‑benar aktif. Jika trafik jarang, total biaya bisa lebih rendah; bila trafik padat, malah lebih mahal daripada Pods. Hitung rasio penggunaan Anda sebelum memutuskan.

Hal yang Perlu Diwaspadai

Lupa mematikan Pod adalah kesalahan paling mahal. Penagihan per menit berarti bahkan saat Anda tidur 8 jam, GPU tetap dihitung. Satu H100 yang tidak dimatikan selama akhir pekan dapat menambah tagihan sekitar $60. Biasakan mematikan setelah selesai, atau atur notifikasi batas anggaran.

Mesin Community Cloud bisa direcycle. Karena berbasis peer‑to‑peer, stabilitasnya tidak sebaik Secure Cloud. Untuk pekerjaan pelatihan lama, pastikan Anda menyimpan checkpoint secara berkala; jangan sampai kerja terhenti di jam ke‑10 karena mesin diambil kembali.

VRAM bukan satu‑satunya bottleneck. Memori sistem, I/O disk, dan bandwidth jaringan juga dapat menjadi penghambat. Mengunduh model 140 GB memakan waktu, dan selama proses itu GPU tetap idle namun tetap dihitung.

Harga dapat berubah. Angka di atas adalah tarif resmi pada saat penulisan artikel; harga cloud GPU berfluktuasi cukup signifikan. Selalu cek halaman resmi sebelum melakukan pemesanan.

Pendapat TheAI Academy

Menurut saya, nilai RunPod bukan hanya pada harga murah, melainkan pada kemampuan menurunkan “biaya coba‑coba” menjadi hampir nol.

Dulu, untuk menguji apakah sebuah ide layak memakai model besar, Anda harus meyakinkan atasan membeli GPU atau menunggu antrian sumber daya perusahaan. Sekarang, dengan tiga dolar Anda dapat menjalankan tiga jam percobaan dan langsung tahu hasilnya. Perubahan ini sangat penting bagi pengembang independen dan tim kecil di Taiwan—kami tidak memiliki anggaran ratusan juta untuk komputasi, jadi setiap rupiah harus dimanfaatkan secara optimal.

Namun, harus jujur menyebutkan kekurangannya. Stabilitas Community Cloud memang tidak sebaik cloud besar; mesin dapat direcycle, kualitas node bervariasi. Posisi mereka adalah “pilihan high‑cost‑performance untuk pengembangan dan eksperimen”, bukan “tempat menjalankan layanan produksi kritis”. Memahami perbedaan ini akan menghindarkan ekspektasi yang keliru.

Pendapat: RunPod adalah pintu masuk GPU paling praktis bagi pengembang independen dan tim kecil di Taiwan. Ingat dua hal ini untuk menghemat sebagian besar biaya—gunakan Network Volume untuk memisahkan data dan komputasi, serta selalu matikan Pod setelah selesai.

Saran khusus untuk pembaca di Indonesia: untuk percobaan pertama, isi saldo minimum, buat satu Pod RTX 4090 di Community Cloud, jalankan tugas kecil yang Anda kuasai untuk memastikan alur kerja. Setelah Anda terbiasa mematikan Pod dan memakai Volume, barulah pertimbangkan kartu yang lebih mahal. Perlu diingat, latency lintas negara dapat terasa pada pengembangan interaktif; untuk pekerjaan lama gunakan tmux atau screen agar tidak terputus saat koneksi terputus. Jika ingin menggabungkan dengan database vektor untuk RAG, lihat tutorial Qdrant; lebih banyak alat cloud dan infrastruktur ada di kategori AI Development Frameworks & Infrastructure.

Sumber Data

(Artikel ini disusun berdasarkan informasi publik resmi; harga dan spesifikasi mengacu pada pengumuman terbaru di situs resmi.)

Pertanyaan yang Sering Diajukan

Mana yang lebih baik, Pods atau Serverless?

Pilih Pods jika Anda membutuhkan interaksi, perlu SSH masuk, atau pekerjaan akan berjalan lebih dari beberapa jam. Pilih Serverless jika Anda hanya memanggil API, lalu lintas tidak konsisten, dan tidak ingin membayar saat idle. Sebagian besar pemula akan menggunakan Pods. Tarif per unit Serverless lebih tinggi, tetapi hanya dikenakan biaya saat worker benar-benar aktif.

Apa perbedaan antara Community Cloud dan Secure Cloud?

Secure Cloud menggunakan pusat data kelas T3/T4, menawarkan stabilitas dan kepatuhan yang lebih baik. Community Cloud adalah sistem peer‑to‑peer, lebih murah namun mesin mungkin diambil kembali. Contohnya, RTX 4090 di Community harganya $0,34 per jam, sedangkan di Secure $0,74 per jam. Gunakan Community untuk eksperimen pengembangan, dan Secure bila ada kebutuhan kepatuhan atau produksi.

Bagaimana cara mencegah tagihan melonjak?

Yang paling penting adalah mematikan Pod setelah selesai—karena tarif per menit berarti GPU tetap dihitung saat Anda tidur. Satu H100 yang dibiarkan seminggu bisa mencapai puluhan dolar. Simpan model dan dataset di Network Volume sehingga Anda bisa mematikan Pod tanpa harus mengunduh ulang setiap kali. Biaya penyimpanan hanya $0,05–$0,10 per GB per bulan.

Apakah perlu menyewa H100 untuk menjalankan model 7B?

Tidak perlu. Untuk inferensi atau fine‑tuning LoRA 7B–13B, RTX 4090 dengan 24 GB VRAM biasanya cukup, dan merupakan GPU dengan rasio harga‑kinerja terbaik (Community $0,34 per jam). Hanya ketika Anda ingin menjalankan model 70B atau fine‑tuning penuh parameter yang memerlukan A100/H100 80 GB. Banyak orang menyewa H100 namun tidak memanfaatkan VRAM-nya secara maksimal.

繁體中文版 →