Hướng dẫn RunPod đầy đủ: thuê một chiếc H100 chạy mô hình, giá theo giờ rẻ hơn bạn nghĩ (kèm giá thực tế từng loại card)

Muốn chạy mô hình mã nguồn mở nhưng không mua nổi card đồ họa? RunPod cho bạn thuê GPU theo phút. Bài này mổ xẻ khác biệt giữa Pod và Serverless, giá thực tế từng loại card, cùng ba chỗ dễ tốn thêm tiền nhất.

Hướng dẫn RunPod đầy đủ: thuê một chiếc H100 chạy mô hình, giá theo giờ rẻ hơn bạn nghĩ (kèm giá thực tế từng loại card)

Một người bạn làm lập trình độc lập ở Hà Nội muốn tinh chỉnh một mô hình mã nguồn mở. Trước tiên anh đi tra giá card đồ họa, thấy báo giá của H100 xong thì lặng lẽ đóng tab. Rồi anh hỏi tôi: "Có cách nào chỉ dùng hai ngày không?"

Có. Và chi phí hai ngày, đại khái bằng một bữa tối kha khá.

RunPod là một trong những nền tảng GPU đám mây giá bình dân hay được gợi ý nhất mấy năm nay. Bài này sẽ nói cho rõ: mở thế nào, chọn loại nào, từng card thực tế bao nhiêu tiền, và ba chỗ dễ tốn thêm tiền một cách khó hiểu nhất.

Đây là gì

RunPod cung cấp tài nguyên tính toán GPU và CPU mở ra là dùng ngay, dùng cho huấn luyện AI, tinh chỉnh, dựng ảnh và các công việc ngốn tính toán khác. Định vị chính thức là để bạn có quyền tự tùy chỉnh hoàn toàn với môi trường tính toán — cái bạn nhận được không phải một API bị giới hạn, mà là một cỗ máy có thể SSH vào.

Nó có hai chế độ chính, chọn sai thì chi phí chênh nhau rất nhiều:

Pods — lấy trực tiếp tài nguyên GPU / CPU chuyên dụng, bạn có quyền kiểm soát hoàn toàn môi trường. Bên chính thức nói là tính phí theo phút, và không thu phí lưu lượng ra vào (ingress / egress). Phù hợp cho phát triển tương tác, huấn luyện và tinh chỉnh.

Serverless — triển khai ứng dụng AI / ML mà không cần tự cấu hình hay quản lý máy chủ, tính phí theo lượng worker thực tế vận hành chứ không đặt trước theo giờ. Phù hợp cho dịch vụ suy luận có lưu lượng không ổn định.

Ngoài ra còn một phân biệt quan trọng: Secure Cloud dùng trung tâm dữ liệu cấp T3 / T4, phù hợp cho mục đích doanh nghiệp; Community Cloud là hệ thống ngang hàng, giá cạnh tranh hơn. Khác biệt nằm ở độ ổn định và tính tuân thủ, không phải ở hiệu năng.

Làm được gì

  • Tinh chỉnh mô hình mã nguồn mở: thuê một chiếc A100 hoặc H100 chạy LoRA hoặc tinh chỉnh toàn tham số vài giờ đến vài ngày.
  • Kiểm thử suy luận mô hình cục bộ: khi muốn thử mô hình 70B tham số nhưng máy chạy không nổi.
  • Dựng ảnh theo lô: tạo lượng lớn với Stable Diffusion hoặc sinh video.
  • Triển khai dịch vụ suy luận: dùng Serverless dựng một điểm cuối API co giãn theo nhu cầu.
  • Thử nghiệm và học tập: muốn nghịch GPU nhưng không muốn bỏ tiền lớn mua phần cứng trước.

Cách dùng (các bước)

Bước một: đăng ký và nạp tiền

RunPod theo hình thức trả trước, nạp tiền rồi mới dùng. Lần đầu nên nạp mức tối thiểu để dò xem thế nào, đừng nạp nhiều một lần.

Bước hai: chọn Pod hay Serverless

Nguyên tắc phán đoán rất đơn giản:

  • Cần tương tác, cần SSH vào sửa đồ, công việc chạy liên tục từ vài giờ trở lên → Pods
  • Là một API sẽ được gọi tới, lưu lượng lúc có lúc không, lúc nhàn rỗi không muốn trả tiền → Serverless

Chín phần mười trường hợp của người mới nên chọn Pods.

Bước ba: chọn GPU và loại đám mây

Đây là bước có khác biệt giá lớn nhất. Dưới đây là mức phí theo giờ do bên chính thức công bố (Community Cloud / Secure Cloud):

GPU VRAM Community Secure
RTX 4090 24GB $0.34 $0.74
A40 48GB $0.35 $0.44
A100 PCIe 80GB $1.19 $1.39
A100 SXM 80GB $1.39 $1.59
H100 PCIe 80GB $1.99 $2.89
H100 SXM 80GB $2.69 $3.29

Quy đổi thử: dùng Community Cloud thuê một chiếc H100 PCIe chạy đủ 24 giờ, khoảng 47,76 USD, tức khoảng hơn 1,2 triệu đồng. Chạy hai ngày chưa tới 2,5 triệu đồng. Đó chính là lý do câu hỏi của bạn tôi có lời giải.

Gợi ý thực tế khi chọn card: chạy suy luận hoặc tinh chỉnh LoRA cho mô hình 7B đến 13B, 24GB của RTX 4090 thường là đủ, mà nó lại là card có hiệu quả chi phí cao nhất. Muốn chạy cỡ 70B hoặc tinh chỉnh toàn tham số thì mới cần 80GB của A100 hoặc H100. Đừng vừa vào đã lao ngay vào H100, nhiều người thuê xong mới phát hiện VRAM dùng chẳng đầy.

Bước bốn: chọn template hoặc container tự tạo

RunPod cung cấp các template dựng sẵn (PyTorch, TensorFlow, các loại WebUI), cũng cho phép chỉ định container image của riêng bạn. Người mới dùng thẳng template PyTorch chính thức là đỡ việc nhất.

Bước năm: cấu hình lưu trữ

Bước này nhiều người bỏ qua nhất, cũng dễ tốn thêm tiền nhất. Phí lưu trữ như sau:

  • Container Disk: mỗi GB mỗi tháng 0,10 USD
  • Volume Disk (đang vận hành): mỗi GB mỗi tháng 0,10 USD
  • Network Storage bản tiêu chuẩn: dưới 1TB mỗi GB mỗi tháng 0,07 USD, trên 1TB là 0,05 USD
  • Network Storage bản hiệu năng cao: mỗi GB mỗi tháng 0,14 USD

Network Volume là lưu trữ bền vững, tồn tại độc lập với tài nguyên tính toán, có thể gắn vào nhiều Pod hoặc điểm cuối Serverless để chia sẻ dữ liệu. Tính năng này rất then chốt — đặt trọng số mô hình và tập dữ liệu lên Network Volume, bạn có thể tắt Pod (ngừng tính phí GPU) mà không phải tải lại vài chục GB mô hình mỗi lần.

Bước sáu: kết nối vào làm việc

Sau khi Pod chạy lên có thể kết nối vào bằng SSH, JupyterLab, VS Code hoặc web proxy, tùy kiểu công việc mà chọn.

Kỹ thuật nâng cao

Tận dụng Network Volume để tách tính toán và dữ liệu. Đây là mẹo tiết kiệm tiền quan trọng nhất. GPU là thứ đắt tính theo phút, lưu trữ là thứ rẻ vài USD mỗi tháng. Đặt dữ liệu lên Volume, cần thì mới mở Pod, khoảng trống ở giữa hoàn toàn không trả tiền GPU.

Community Cloud thử trước, Secure Cloud dùng sau. Giai đoạn phát triển và thử nghiệm dùng Community Cloud, với RTX 4090 chênh giá hơn gấp đôi. Đợi đến khi chạy công việc chính thức hoặc có yêu cầu tuân thủ mới chuyển sang Secure Cloud.

Dùng lâu dài thì xem Savings Plan. Bên chính thức cung cấp gói tiết kiệm cho việc dùng lâu dài, nếu bạn chắc chắn sẽ chạy liên tục vài tuần thì đáng tính thử.

Phải hiểu rõ logic tính phí của Serverless. Mức phí Serverless cao hơn Pod (ví dụ A100 80GB là 2,72 USD mỗi giờ, H100 80GB là 4,79 USD, RTX 4090 là 1,10 USD), nhưng nó chỉ tính phí khi worker thực tế vận hành. Khi lưu lượng thưa thớt thì tổng chi phí thấp hơn, khi lưu lượng dày đặc thì ngược lại đắt hơn Pod. Tính thử tỷ lệ sử dụng thực tế của bạn rồi hãy quyết định.

Lưu ý

Quên tắt Pod là lỗi đắt nhất. Tính phí theo phút nghĩa là tám tiếng bạn ngủ nó cũng đang tính phí. Một chiếc H100 quên tắt một cuối tuần, hóa đơn khoảng sáu mươi mấy USD. Hãy tập thói quen dùng xong là dừng, hoặc đặt sẵn cảnh báo ngân sách.

Máy của Community Cloud có thể bị thu hồi. Đây là bản chất của hệ thống ngang hàng, độ ổn định không bằng Secure Cloud. Các công việc huấn luyện dài nhất định phải làm checkpoint tốt, đừng chạy đến giờ thứ mười mới phát hiện máy không còn.

VRAM không phải nút thắt cổ chai duy nhất. Bộ nhớ hệ thống, I/O đĩa và băng thông mạng đều có thể trở thành giới hạn. Tải một trọng số mô hình 140GB cũng mất thời gian, mà trong khoảng đó GPU đang chạy không mà vẫn tính phí.

Giá sẽ biến động. Các con số ở trên là mức phí bên chính thức công bố lúc viết bài, giá GPU đám mây dao động không nhỏ, trước khi đặt hàng thực tế nhất định phải lên website chính thức xác nhận.

Bình luận của TheAI Academy

Tôi thấy giá trị thật sự của RunPod không nằm ở rẻ, mà ở chỗ nó hạ chi phí của việc "thử xem sao" xuống gần như bằng không.

Trước đây muốn kiểm chứng một ý tưởng có nên dùng mô hình lớn hay không, bạn phải thuyết phục sếp mua card trước, hoặc xếp hàng đợi tài nguyên GPU của công ty. Bây giờ bạn bỏ ba USD chạy ba tiếng là biết đáp án. Thay đổi này đặc biệt quan trọng với lập trình viên độc lập và đội nhỏ ở Việt Nam — chúng ta không có ngân sách tính toán động một cái là vài tỷ đồng, cái ta dựa vào là tiêu từng đồng cho đúng chỗ.

Nhưng cũng phải nói thật nhược điểm. Độ ổn định của Community Cloud đúng là không bằng đám mây của các ông lớn, tình trạng máy bị thu hồi, chất lượng node không đồng đều là có thật. Định vị của nó là "lựa chọn hiệu quả chi phí cao cho phát triển và thử nghiệm", không phải "nơi chạy dịch vụ then chốt của môi trường production". Phân biệt rõ chuyện này thì sẽ không có kỳ vọng sai.

Bình luận: RunPod là cửa vào GPU thực tế nhất cho lập trình viên độc lập và đội nhỏ ở Việt Nam. Nhớ hai điều là tiết kiệm được quá nửa số tiền oan — dùng Network Volume để tách dữ liệu và tính toán, và, dùng xong nhớ tắt.

Gợi ý cụ thể cho độc giả Việt Nam: nếu dùng lần đầu, hãy nạp mức tối thiểu, mở một Pod RTX 4090 trên Community Cloud, chạy một tác vụ nhỏ bạn quen thuộc để đi thông quy trình. Xác nhận rằng bạn sẽ tắt Pod, sẽ dùng Volume rồi mới cân nhắc mở card đắt hơn. Ngoài ra nhắc thêm, độ trễ khi kết nối xuyên quốc gia có ảnh hưởng cảm nhận rõ với phát triển tương tác, công việc dài nên dùng tmux hoặc screen để tránh mất kết nối làm gián đoạn. Muốn kết hợp cơ sở dữ liệu vector làm RAG, có thể xem hướng dẫn Qdrant của chúng tôi; thêm công cụ đám mây và hạ tầng ở mục Framework phát triển và hạ tầng AI.

Nguồn tham khảo

(Bài viết được tổng hợp theo thông tin công khai chính thức, giá và thông số lấy theo công bố mới nhất trên website chính thức.)

Câu hỏi thường gặp

Pods và Serverless nên chọn cái nào?

Cần tương tác, cần SSH vào thao tác, công việc chạy liên tục vài giờ trở lên thì chọn Pods; nếu là một API sẽ được gọi tới, lưu lượng lúc có lúc không, lúc nhàn rỗi không muốn trả tiền thì chọn Serverless. Chín phần mười trường hợp người mới nên dùng Pods. Mức phí đơn vị của Serverless cao hơn, nhưng chỉ tính phí khi worker thực tế vận hành.

Community Cloud và Secure Cloud khác nhau chỗ nào?

Secure Cloud dùng trung tâm dữ liệu cấp T3 / T4, độ ổn định và tuân thủ tốt hơn; Community Cloud là hệ thống ngang hàng, giá thấp hơn nhưng máy có thể bị thu hồi. Lấy RTX 4090 làm ví dụ, Community 0,34 USD mỗi giờ, Secure 0,74 USD. Phát triển thử nghiệm dùng Community, chính thức hoặc có yêu cầu tuân thủ thì dùng Secure.

Làm sao tránh hóa đơn tăng vọt?

Quan trọng nhất là dùng xong là dừng Pod — tính phí theo phút nghĩa là lúc bạn ngủ nó cũng đang tính phí, một chiếc H100 quên tắt một cuối tuần khoảng sáu mươi mấy USD. Ngoài ra đặt mô hình và tập dữ liệu lên Network Volume là có thể tắt Pod mà không phải tải lại mỗi lần, phí lưu trữ mỗi GB mỗi tháng chỉ 0,05 đến 0,10 USD.

Chạy mô hình 7B có cần thuê H100 không?

Không cần. Suy luận hoặc tinh chỉnh LoRA cho 7B đến 13B, 24GB VRAM của RTX 4090 thường là đủ dùng, mà nó lại là card có hiệu quả chi phí cao nhất (Community 0,34 USD mỗi giờ). Muốn chạy cỡ 70B hoặc tinh chỉnh toàn tham số mới cần 80GB của A100 / H100. Nhiều người thuê H100 rồi mới phát hiện VRAM dùng chẳng đầy.

繁體中文版 →