Diffbot 是一套 AI 网页资料萃取平台,能把任何页面自动转成干净、结构化的 JSON,不必为每个网站写爬虫规则。它有文章、商品、讨论串等多种撷取 API,也提供 Crawlbot 大规模抓取。
更特别的是它自建了涵盖数十亿实体(公司、人物、产品等)的知识图谱,可用来做公司情报、资料补全与研究。对需要把网路上非结构化资讯变成可用资料的开发者与资料团队很实用。
主要功能
- 把任意网页转成结构化 JSON
- 文章/商品/讨论串等撷取 API
- Crawlbot 大规模自动抓取
- 数十亿实体的知识图谱
- 公司情报与资料补全查询
优点
- 免为每个网站写爬虫规则
- 知识图谱可直接查实体
- 适合大规模资料工程
缺点
- 偏开发者取向、需整合
- 进阶用量为付费
使用场景
- 把网页批次转成结构化资料
- 公司/人物资料补全
- 市场研究与竞争情报
常见问题
Diffbot 能做什么?
把任何网页自动转成结构化 JSON,并提供涵盖数十亿实体的知识图谱查询。
要自己写爬虫吗?
不用,它用 AI 自动辨识页面结构,免逐站写规则。
有免费方案吗?
提供免费试用与分级付费方案。