Panduan Lengkap Firecrawl: Ubah Situs Apa Pun Menjadi Markdown yang Dipahami LLM
Yang paling memakan waktu saat membuat RAG atau agen AI bukan memilih model, melainkan membersihkan data web. Firecrawl menyediakan tujuh endpoint seperti Scrape, Crawl, Map, Search, satu baris panggilan mengembalikan Markdown yang bersih. Tulisan ini dari kuota gratis hingga cara menghitung poin, serta menjelaskan batas hukum yang wajib diperhatikan sebelum menyalin situs orang.
Siapa pun yang pernah membuat RAG paham frustrasi itu: Anda menghabiskan dua jam memilih model dan mengatur basis data vektor, akhirnya tersangkut pada satu masalah konyol—halaman web yang ditarik mengandung bilah navigasi, iklan, dan spanduk persetujuan cookie, dan separuh halaman yang ditarik dengan requests hanya berupa cangkang kosong, karena kontennya dirender JavaScript.
Firecrawl adalah alat yang khusus memecahkan bagian ini.
Apa Itu Firecrawl
Firecrawl adalah API ekstraksi data web, lulusan Y Combinator, dengan positioning resmi "cara termudah memperoleh konteks dari internet". Anda melempar satu URL, ia mengembalikan Markdown yang bersih—iklan, navigasi, skrip semuanya dibersihkan, hanya menyisakan konten yang bermakna.
Beda terbesarnya dengan menulis crawler sendiri ada dua. Pertama, ia menangani rendering JavaScript, yaitu menjalankan halaman sampai selesai dulu baru menarik kontennya, dan ini memecahkan penyebab kegagalan penarikan paling umum situs modern. Kedua, format keluarannya memang untuk disuap ke model bahasa besar, jadi Anda tak perlu lagi menulis banyak logika pembersihan.
Bisa Melakukan Apa
Resmi saat ini menyediakan tujuh endpoint, masing-masing untuk skenario penggunaan berbeda:
| Endpoint | Kegunaan | Penagihan Poin |
|---|---|---|
| Scrape | Menarik satu halaman | 1 poin per halaman |
| Crawl | Merayapi seluruh situs secara rekursif | 1 poin per halaman |
| Map | Cepat memperoleh struktur halaman situs | 1 poin per halaman |
| Search | Pencarian web dan menarik konten | 2 poin per 10 hasil |
| Interact | Otomatisasi browser, menangani login dan interaksi | 2 poin per menit |
| Monitor | Melacak perubahan halaman | 1 poin per pengecekan |
| Agent (pratinjau) | Integrasi agen AI | Harga dinamis, gratis 5 kali per hari |
Paketnya terbagi enam jenjang: Free, Hobby, Standard, Growth, Scale, dan Enterprise. Paket gratis seribu poin per bulan, dua permintaan paralel; dihitung dengan tagihan tahunan, Hobby sekitar 16 dolar AS per bulan dengan lima ribu poin, Standard sekitar 83 dolar dengan seratus ribu poin, Growth sekitar 333 dolar dengan lima ratus ribu poin, Scale sekitar 599 dolar dengan satu juta poin. Semua paket swalayan mendukung isi ulang otomatis dengan kelipatan lima dolar saat poin habis.
Cara Pakai: Dari Pendaftaran hingga Penarikan Pertama
Langkah pertama: daftar untuk mendapat kunci API
Daftar di firecrawl.dev, paket gratis tak butuh kartu kredit. Setelah login Anda bisa mendapat kunci API di dasbor, ingat simpan ke variabel lingkungan, jangan menuliskannya langsung dalam kode.
Langkah kedua: tarik halaman pertama
Cara termudah adalah endpoint Scrape, lempar satu URL, tentukan format Markdown, dan kembaliannya adalah konten yang sudah dibersihkan. Dalam praktik Anda mendapat dua hal: kolom markdown adalah teks utama, kolom metadata memuat judul, deskripsi, bahasa, dan lainnya. Yang terakhir sangat berguna saat membangun indeks, jangan diabaikan.
Langkah ketiga: rayapi seluruh situs
Endpoint Crawl akan mulai dari URL awal yang Anda beri, mengikuti tautan secara rekursif. Ada beberapa parameter yang wajib disetel:
- Batas jumlah halaman: jika tak disetel, satu situs besar bisa dengan mudah menghabiskan seluruh poin sebulan Anda
- Pembatas path: hanya merayapi konten di bawah
/docs/, jangan sampai melenceng merayapi blog dan profil perusahaan - Aturan pengecualian: kecualikan halaman tak bernilai seperti halaman login dan halaman hasil pencarian
Kebiasaan saya adalah memakai endpoint Map dulu untuk melihat struktur situs sekali, memastikan total halaman dalam rentang wajar, baru memutuskan apakah akan menjalankan Crawl. Langkah ini bisa menghindari sebagian besar kejutan poin.
Langkah keempat: sambungkan ke alur RAG Anda
Alur standar setelah mendapat Markdown adalah: memenggal (chunking), memvektorkan, menyimpan ke basis data vektor. Markdown Firecrawl mempertahankan hierarki judul, dan ini terutama ramah bagi strategi memenggal dengan batas judul—dibanding lumpur berantakan hasil konversi HTML ke teks murni, mutunya jauh lebih baik.
Teknik Lanjutan
Map dulu baru Crawl, selalu. Inilah yang paling ingin saya tekankan. Map hanya butuh sangat sedikit poin untuk memberi tahu Anda situs ini punya berapa halaman dan seperti apa strukturnya. Melewati langkah ini langsung Crawl adalah cara paling umum menghabiskan poin.
Pakai ekstraksi terstruktur alih-alih menulis parser sendiri. Scrape mendukung penentuan schema, agar model langsung mengekstrak isi halaman menjadi kolom yang Anda inginkan (misalnya nama produk, harga, status stok). Ini jauh lebih stabil dari menarik Markdown lalu menulis regex sendiri, terutama saat halaman berganti versi.
Jumlah paralel adalah hambatan nyata. Versi gratis hanya dua permintaan paralel, sehingga menarik seribu halaman akan sangat lambat. Jika Anda memvalidasi prototipe, tarik lima puluh halaman dulu untuk memastikan alur berjalan, jangan sejak awal menjalankan seluruh situs.
Monitor cocok untuk melacak kompetitor. Jika Anda ingin memantau perubahan halaman harga atau halaman produk pesaing, endpoint Monitor lebih praktis daripada menjadwalkan Scrape sendiri, dan tiap pengecekan hanya dihitung satu poin.
Padukan dengan alat observabilitas. Jika alur RAG Anda tersambung ke Helicone atau Langfuse, ingat catat sekalian URL sumber penarikan. Saat kelak menelusuri "mengapa model menjawab salah", delapan puluh persen masalah ada pada data sumber, bukan model.
Hal yang Perlu Diperhatikan
Batas hukum wajib dipikirkan matang dulu. Ini bagian yang menurut saya paling penting. Alat Firecrawl sendiri netral, tetapi tanggung jawab hukum atas tindakan penarikan ada pada pengguna. Wajib patuhi robots.txt dan ketentuan layanan situs sasaran; penggunaan komersial terutama harus memperhatikan hak cipta dan hak basis data. Regulasi hak cipta memiliki ketentuan jelas soal reproduksi, dan menarik seluruh konten orang lain lalu memasukkannya ke produk sendiri, risikonya tak rendah. Bila ragu carilah nasihat hukum, jangan bermental "toh semua orang menariknya".
Konsumsi poin sulit diperkirakan di awal. Sebuah situs dokumen yang tampak hanya tiga puluh halaman, bisa mengembang menjadi tiga ratus halaman karena kombinasi paginasi dan parameter. Menyetel batas jumlah halaman adalah perlindungan diri yang perlu.
Tak semua situs bisa ditarik. Situs yang butuh login, punya mekanisme anti-crawler ketat, atau tegas melarang akses otomatis—endpoint Interact bisa menangani sebagian skenario interaksi, tetapi tak mahakuasa. Menghadapi situs yang tak bisa ditarik, pastikan dulu apakah memang sengaja dihalangi pihak lain—jika ya, itu tandanya mereka memberi tahu Anda jangan menariknya.
Mutu keluaran tetap perlu diperiksa acak. Konversi Markdown berkinerja sangat baik di kebanyakan situs, tetapi halaman dengan tata letak khusus (banyak tabel, struktur bersarang rumit) bisa terdistorsi. Sebelum membangun indeks periksa acak sepuluh halaman untuk memastikan kelengkapan konten.
Ulasan TheAI Academy
Positioning Firecrawl sangat jelas, jelas sampai agak membosankan—ia hanya membungkus pekerjaan berat "mengubah web menjadi teks bersih" menjadi API, tanpa ambisi lain.
Tetapi justru inilah alasan ia berguna. Siapa pun yang membuat RAG tahu, yang paling memakan waktu tak pernah memilih model atau menyetel parameter, melainkan prapengolahan data. Meng-outsource bagian ini membuat waktu Anda bisa dicurahkan ke tempat yang benar-benar membedakan.
Ulasan: yang ia jual bukan teknologi, melainkan akhir-akhir pekan yang tak lagi Anda habiskan untuk memelihara crawler.
Tiga saran konkret bagi developer di Indonesia. Pertama, pakai dulu seribu poin gratis untuk menjalankan seluruh alur baru mempertimbangkan berbayar, kuota ini cukup untuk memvalidasi prototipe. Kedua, biasakan "Map dulu baru Crawl", satu tindakan ini bisa menghemat sebagian besar pemborosan poin. Ketiga, dan paling penting—sebelum menekan Crawl, luangkan lima menit melihat robots.txt dan ketentuan layanan situs sasaran. Bisa dilakukan secara teknis, tak berarti boleh dilakukan secara hukum.
Lebih banyak alat developer bisa ditemukan di direktori alat developer AI, dan Anda juga bisa rujuk template prompt untuk merancang prompt ekstraksi data Anda.
Pertanyaan yang Sering Diajukan
Apakah kuota gratis cukup untuk membuat prototipe?
Seribu poin per bulan kira-kira bisa menarik seribu halaman, cukup untuk membangun prototipe dan memvalidasi alur. Batasannya permintaan paralel hanya dua, sehingga penarikan dalam jumlah besar akan lambat. Disarankan tarik lima puluh hingga seratus halaman dulu untuk memastikan mutu, baru putuskan naik paket.
Dibanding menulis crawler sendiri, kapan harus memakainya?
Jika hanya menarik satu-dua situs berstruktur stabil, menulis sendiri lebih hemat. Tetapi begitu harus menghadapi banyak situs, rendering JavaScript, dan mekanisme anti-crawler, biaya pemeliharaan naik cepat. Ketika Anda menemukan insinyur harus menghabiskan waktu memperbaiki crawler tiap bulan, saat itulah harus beralih.
Apakah menarik situs orang lain legal?
Alatnya netral, tanggung jawab ada pada pengguna. Wajib patuhi robots.txt dan ketentuan layanan situs sasaran, dan penggunaan komersial harus khusus memperhatikan hak cipta dan hak basis data. Regulasi hak cipta punya ketentuan jelas soal reproduksi, jadi bila ragu carilah nasihat hukum.
Mengapa harus memakai Map dulu baru Crawl?
Map hanya butuh sangat sedikit poin untuk memberi tahu Anda situs punya berapa halaman dan strukturnya bagaimana. Melewati langkah ini langsung Crawl mudah membuat jumlah halaman jauh melampaui perkiraan karena paginasi atau kombinasi parameter, dan sekali jalan langsung menghabiskan poin bulan itu.