Cerebrium

即時 AI 的 Serverless GPU 平台:語音代理、影片模型、LLM 秒級冷啟動與自動擴展,依秒計費

免費或付費
一句話介紹:即時 AI 的 Serverless GPU 平台:語音代理、影片模型、LLM 秒級冷啟動與自動擴展,依秒計費

Cerebrium 是一家 Serverless GPU 基礎設施公司,主打「即時 AI」:語音代理、影片模型、LLM 這類對延遲很敏感的工作負載。它的核心承諾是冷啟動快、擴展快、按秒收費、不用預訂容量。

官網的冷啟動比較很能說明定位:以 vLLM 跑 Qwen 為例,Cerebrium 開啟快照功能時 3.8 秒、不開 42 秒,對照另一家供應商 71 秒、自建 EKS/GKE 156 秒;Stable Diffusion XL 則是 3.38 秒對 91 秒。關鍵技術是記憶體與 GPU 快照,讓容器可以快速還原。容量方面官網寫可用 GPU 超過 2,500 張,區域包括 us-east-1、eu-west-2、eu-north-1、ap-south-1,橫跨多個雲,突發流量時自動擴展、不用做容量規劃。GPU 種類從 T4、L4、A10、L40s、A100、RTX PRO 6000 到 H100、H200、B200 都有,也能純 CPU 執行,用 CLI 一行指令就能在 8 張 H100 上跑訓練腳本。方案方面,免費的 Hobby 有 3 個席次、3 個部署應用、5 個並行 GPU;Standard 每月 $100 開放不限應用、30 個 GPU 並行與自訂網域;Enterprise 有無上限並行 GPU、專屬 Slack 支援與 ML 工程服務。

功能特色與適用場景:如果你在做語音代理、即時影片生成這類「使用者在等」的產品,冷啟動秒數直接影響體驗,Cerebrium 就是為這類情境設計的。台灣團隊要注意它的區域在美國、歐洲與印度,沒有東亞節點,服務台灣使用者的語音代理會多一段跨洋延遲,最好實測端到端延遲再決定;按秒計費也意味著流量不穩的服務成本較好控制。

TheAI學院 編輯建議

編輯實測後的真心話

做語音代理的人都知道,延遲是最難藏的缺點。Cerebrium 把快照做成冷啟動的解法,方向對了;台灣團隊唯一要擔心的是它離我們有點遠。

— theai 編輯團隊

主要功能

  • 記憶體與 GPU 快照,冷啟動可縮到數秒
  • 依秒計費,T4 到 B200 多種 GPU 與純 CPU
  • 突發流量自動擴展,無需預訂容量
  • 跨多雲多區域(美、歐、印度)超過 2,500 張 GPU
  • CLI 部署與訓練、內建觀測
  • Enterprise 提供 ML 工程服務與專屬支援

適用場景

  • 部署低延遲的語音代理模型
  • 即時影片或圖像生成服務的後端推論
  • 自架開源 LLM 並依流量自動擴展
  • 短期在多張 H100 上跑訓練任務
  • 流量不穩的 AI 功能用按秒計費控制成本

Cerebrium 的優點與缺點

優點

  • 冷啟動快,適合語音、影片等即時應用
  • 按秒計費,低流量服務成本可控
  • 免費 Hobby 方案可先試

缺點

  • 沒有東亞區域,服務台灣使用者會有跨洋延遲
  • Standard 方案另有每月 $100 基本費
  • 免費方案並行 GPU 數有限

價格方案

Hobby 免費+運算費;Standard $100/月+運算費;Enterprise 客製。GPU 依秒計費,例如 H100 每秒 $0.000944、A10 每秒 $0.000306,前 100GB 儲存免費,以官網為準

Cerebrium 常見問題

Cerebrium 怎麼計費?

運算依秒計費,例如 H100 每秒 $0.000944、L4 每秒 $0.000222;另有方案費,Hobby 免費、Standard 每月 $100、Enterprise 客製。

有哪些區域?

官網列出 us-east-1、eu-west-2、eu-north-1、ap-south-1。

冷啟動有多快?

官網的比較顯示,以 vLLM 跑 Qwen 開啟快照時約 3.8 秒,實際表現依模型與設定而定。

使用者評價

還沒有足夠評價,搶先分享你的使用心得!

寫下你的評價

評論將經審核後公開。

Cerebrium 的替代方案

查看相似的 AI 工具 →

相關 AI 工具

猜你也想看的AI 開發框架與基建

前往官網 ↗