Tutorial Lengkap Firecrawl: Tukar Mana-mana Laman Web Menjadi Markdown yang Difahami LLM
Membuat RAG atau ejen AI, yang paling memakan masa bukan memilih model, tetapi membersihkan data laman web. Firecrawl menyediakan tujuh titik akhir seperti Scrape, Crawl, Map, Search, dan satu baris panggilan memulangkan Markdown yang bersih. Artikel ini menjelaskan daripada kuota percuma hingga cara mengira mata, serta menerangkan sempadan undang-undang yang wajib diberi perhatian sebelum merayap laman orang lain.
Sesiapa yang pernah membuat RAG memahami kekecewaan itu: anda menghabiskan dua jam memilih model dan menetapkan pangkalan data vektor, akhirnya tersekat pada satu masalah bodoh — laman web yang dirayap ada bar navigasi, ada iklan, ada sepanduk persetujuan Cookie, dan separuh halaman apabila dirayap dengan requests hanya menghasilkan cangkerang kosong, kerana kandungannya dipaparkan oleh JavaScript.
Firecrawl ialah alat yang khusus menyelesaikan bahagian ini.
Apa Itu Firecrawl
Firecrawl ialah API pengekstrakan data laman web, berasal daripada Y Combinator, dengan kedudukan rasminya ialah "cara paling mudah untuk memperoleh konteks daripada internet". Anda memasukkan satu URL, dan ia memulangkan satu Markdown yang bersih — iklan, navigasi, skrip semuanya dibuang, hanya kandungan yang bermakna ditinggalkan.
Perbezaan terbesarnya dengan menulis perayap sendiri ada dua. Pertama, ia akan mengendalikan pemaparan JavaScript, iaitu menjalankan halaman sepenuhnya dahulu sebelum merayap kandungan, dan ini menyelesaikan punca kegagalan rayapan yang paling lazim pada laman web moden. Kedua, format outputnya ialah untuk dimakan model bahasa besar, dan anda tidak perlu menulis banyak logik pembersihan lagi.
Apa yang Boleh Dilakukan
Pihak rasmi kini menyediakan tujuh titik akhir, dan setiap satu sepadan dengan senario penggunaan yang berbeza:
| Titik Akhir | Kegunaan | Caj Mata |
|---|---|---|
| Scrape | Merayap satu halaman | 1 mata setiap halaman |
| Crawl | Merayap keseluruhan laman secara rekursif | 1 mata setiap halaman |
| Map | Memperoleh struktur halaman laman dengan pantas | 1 mata setiap halaman |
| Search | Carian internet dan mengambil kandungan | 2 mata setiap 10 hasil |
| Interact | Automasi pelayar, mengendalikan log masuk dan interaksi | 2 mata setiap minit |
| Monitor | Menjejaki perubahan halaman | 1 mata setiap semakan |
| Agent (dalam pratonton) | Integrasi ejen AI | Harga dinamik, 5 kali percuma sehari |
Pelan terbahagi kepada enam peringkat Free, Hobby, Standard, Growth, Scale dan Enterprise. Pelan percuma seribu mata sebulan, dua permintaan selari; dengan pengiraan bayaran tahunan, Hobby kira-kira AS$16 sebulan termasuk lima ribu mata, Standard kira-kira AS$83 termasuk seratus ribu mata, Growth kira-kira AS$333 termasuk lima ratus ribu mata, Scale kira-kira AS$599 termasuk sejuta mata. Semua pelan layan diri menyokong penambahan nilai automatik dalam unit lima dolar apabila mata habis.
Cara Guna: Daripada Pendaftaran hingga Rayapan Pertama
Langkah pertama: Daftar untuk Mendapatkan Kunci API
Pergi ke firecrawl.dev untuk mendaftar, dan pelan percuma tidak memerlukan kad kredit. Selepas log masuk anda boleh memperoleh kunci API di papan pemuka, dan ingat simpannya dalam pemboleh ubah persekitaran, jangan tulis mati dalam kod.
Langkah kedua: Rayap Halaman Pertama
Cara paling mudah ialah titik akhir Scrape, masukkan satu URL, tetapkan format Markdown, dan yang kembali ialah kandungan yang telah dibersihkan. Dalam praktik anda akan memperoleh dua perkara: medan markdown ialah teks utama, dan medan metadata mengandungi maklumat seperti tajuk, penerangan, bahasa. Yang kedua sangat berguna ketika membina indeks, jadi jangan abaikannya.
Langkah ketiga: Rayap Keseluruhan Laman
Titik akhir Crawl akan bermula daripada URL permulaan yang anda beri, mengikut pautan secara rekursif. Di sini ada beberapa parameter yang mesti ditetapkan:
- Had halaman: jika tidak ditetapkan, satu laman besar boleh dengan mudah memakan seluruh mata anda sebulan
- Had laluan: hanya merayap kandungan di bawah
/docs/, jangan pergi merayap blog dan pengenalan syarikat - Peraturan pengecualian: kecualikan halaman yang tiada nilai seperti halaman log masuk, halaman hasil carian
Tabiat saya ialah menggunakan titik akhir Map dahulu untuk melihat struktur laman sekali, mengesahkan jumlah halaman dalam julat yang munasabah, kemudian barulah memutuskan sama ada mahu menjalankan Crawl. Langkah ini boleh mengelakkan kebanyakan kejadian mata yang tidak dijangka.
Langkah keempat: Sambung ke Aliran RAG Anda
Proses standard selepas memperoleh Markdown ialah: pembahagian blok (chunking), pemvektoran, simpan ke pangkalan data vektor. Markdown Firecrawl mengekalkan hierarki tajuk, dan ini terutamanya mesra kepada strategi yang menggunakan tajuk sebagai sempadan pembahagian blok — berbanding gumpalan lumpur selepas HTML ditukar kepada teks tulen, kualitinya jauh berbeza.
Teknik Lanjutan
Map dahulu sebelum Crawl, sentiasa. Inilah perkara yang paling ingin saya tekankan. Map hanya memerlukan sedikit mata untuk memberitahu anda laman ini ada berapa halaman dan struktur rupanya bagaimana. Melangkau langkah ini dan terus Crawl ialah cara membakar mata yang paling lazim.
Guna pengekstrakan berstruktur menggantikan menulis penghurai sendiri. Scrape menyokong penetapan schema, membiarkan model terus mengekstrak kandungan halaman menjadi medan yang anda mahu (contohnya nama produk, harga, status stok). Ini jauh lebih stabil daripada merayap Markdown kembali kemudian menulis ungkapan biasa sendiri, terutamanya ketika halaman diubah suai semula.
Bilangan selari ialah kesesakan sebenar. Versi percuma hanya ada dua permintaan selari, dan merayap seribu halaman akan sangat perlahan. Jika anda membuat pengesahan prototaip, rayap dahulu lima puluh halaman untuk mengesahkan aliran boleh dilaksanakan sudah cukup, jangan menjalankan seluruh laman sejak awal.
Monitor sesuai untuk membuat penjejakan pesaing. Jika anda mahu memantau perubahan halaman harga atau halaman produk pesaing, titik akhir Monitor lebih mudah daripada menjadualkan Scrape sendiri, dan setiap semakan hanya dikira satu mata.
Gandingkan dengan alat kebolehcerapan. Jika aliran RAG anda menyambungkan Helicone atau Langfuse, ingat merekod sekali URL sumber yang dirayap. Kelak apabila menyiasat "mengapa model menjawab salah", lapan puluh peratus masalah ada pada data sumber, bukan model.
Perkara yang Perlu Diberi Perhatian
Sempadan undang-undang mesti difikirkan dengan jelas dahulu. Inilah bahagian yang saya rasa paling penting. Alat Firecrawl itu sendiri neutral, tetapi tanggungjawab undang-undang tindakan rayapan terletak pada pengguna. Pastikan mematuhi robots.txt dan terma perkhidmatan laman sasaran; kegunaan komersial terutamanya perlu memberi perhatian pada hak cipta dan hak pangkalan data. Undang-undang hak cipta tempatan mempunyai peraturan yang jelas tentang penggandaan, dan merayap keseluruhan kandungan orang lain untuk dimasukkan ke dalam produk sendiri, risikonya tidak rendah. Apabila ragu-ragu sila dapatkan nasihat undang-undang, jangan bersikap "lagipun semua orang merayap".
Penggunaan mata sukar dianggarkan terlebih dahulu. Satu laman dokumen yang kelihatan hanya tiga puluh halaman, mungkin berkembang menjadi tiga ratus halaman kerana gabungan penomboran halaman dan parameter. Menetapkan had halaman ialah perlindungan diri yang perlu.
Bukan semua laman boleh dirayap. Laman yang memerlukan log masuk, mempunyai mekanisme anti-rayapan yang ketat, atau dengan jelas melarang capaian automatik, titik akhir Interact boleh mengendalikan sebahagian situasi interaksi, tetapi bukan serba boleh. Apabila berjumpa laman yang tidak boleh dirayap, sahkan dahulu sama ada ia sengaja disekat pihak lawan — jika ya, maka itu memberitahu anda supaya jangan merayapnya.
Kualiti output masih perlu disemak sampel. Penukaran Markdown berprestasi sangat baik pada kebanyakan laman, tetapi halaman dengan susun atur khas (banyak jadual, struktur bersarang kompleks) mungkin herot. Sebelum membina indeks semak sampel sepuluh halaman secara rawak dahulu, mengesahkan kandungan lengkap.
Ulasan TheAI Academy
Kedudukan Firecrawl sangat jelas, sehingga jelasnya agak membosankan — ia sekadar membungkus kerja susah "menukar laman web menjadi teks bersih" menjadi API, tiada cita-cita lain.
Tetapi inilah sebab ia senang digunakan. Sesiapa yang membuat RAG tahu, yang paling memakan masa tidak pernah memilih model atau menala parameter, tetapi prapemprosesan data. Sumber luarkan bahagian ini, dan masa anda boleh dibelanjakan pada tempat yang benar-benar mempunyai pembezaan.
Ulasan: Yang dijualnya bukan teknologi, tetapi hujung-hujung minggu yang anda tidak perlu lagi menyelenggara perayap.
Tiga cadangan konkrit untuk pembangun. Pertama, gunakan dahulu seribu mata percuma untuk menjalankan keseluruhan aliran sebelum mempertimbangkan bayaran, kerana kuota ini cukup untuk mengesahkan prototaip. Kedua, biasakan tabiat "Map dahulu sebelum Crawl", dan satu tindakan ini boleh menjimatkan sebahagian besar pembaziran mata. Ketiga, dan yang paling penting — sebelum menekan Crawl, luangkan dahulu lima minit melihat robots.txt dan terma perkhidmatan laman lawan. Boleh dilakukan secara teknikal, tidak bermakna boleh dilakukan secara undang-undang.
Lebih banyak alat pembangun boleh ditemui di direktori alat pembangun AI, dan anda juga boleh merujuk templat gesaan untuk mereka bentuk gesaan pengekstrakan data anda.
Soalan Lazim
Adakah kuota percuma cukup untuk membuat prototaip?
Seribu mata sebulan kira-kira boleh merayap seribu halaman, dan ini cukup untuk membina prototaip dan mengesahkan aliran. Hadnya ialah permintaan selari hanya dua, jadi rayapan besar-besaran akan sangat perlahan. Disyorkan rayap dahulu lima puluh hingga seratus halaman untuk mengesahkan kualiti sebelum memutuskan sama ada mahu naik taraf.
Berbanding menulis perayap sendiri, bila patut menggunakannya?
Jika hanya merayap satu dua laman yang strukturnya stabil, menulis sendiri lebih menjimatkan. Tetapi sebaik sahaja perlu berhadapan dengan berbilang laman, pemaparan JavaScript dan mekanisme anti-rayapan, kos penyelenggaraan akan meningkat dengan pantas. Apabila anda mendapati jurutera perlu menghabiskan masa membaiki perayap setiap bulan, maka itulah masa untuk bertukar.
Adakah merayap laman web orang lain sah?
Alat itu neutral, dan tanggungjawab pada pengguna. Pastikan mematuhi robots.txt dan terma perkhidmatan laman sasaran, dan kegunaan komersial perlu memberi perhatian khas pada hak cipta serta hak pangkalan data. Undang-undang hak cipta tempatan mempunyai peraturan yang jelas tentang penggandaan, jadi apabila ragu-ragu sila dapatkan nasihat undang-undang.
Mengapa perlu guna Map dahulu sebelum Crawl?
Map hanya memerlukan sedikit mata untuk memberitahu anda laman ada berapa halaman dan bagaimana strukturnya. Melangkau langkah ini dan terus Crawl mudah menyebabkan rayapan halaman jauh melebihi jangkaan kerana penomboran halaman atau gabungan parameter, dan sekali gus menghabiskan mata bulan itu.