Crunchbase 爬虫
本仓库提供两种从 Crunchbase 提取商情数据的方法基础爬虫脚本基于浏览器自动化的轻量级方案适用于有限数据采集。Bright Data Crunchbase 爬虫 API面向高并发、可扩展、免维护的企业级稳定数据采集方案。目录1. 基础版 Crunchbase 爬虫功能先决条件实现示例输出重要限制与挑战2. Bright Data Crunchbase 爬虫 API关键优势开始使用API 方法A. 通过 URL 采集 Crunchbase 数据B. 按关键词发现 Crunchbase 数据API 配置与交付选项零代码爬虫界面备选方案预采集的 Crunchbase 数据集资源与支持1. 基础版 Crunchbase 爬虫一个 Python 实现示例用于从 Crunchbase 公司页面提取基础公司数据。功能该脚本可采集公开可用的数据点包括公司基础信息简介、官网、成立日期联系方式邮箱、电话运营信息状态、员工规模、所在地领导层信息创始人行业分类先决条件已安装 Python 3.x安装 SeleniumBase 库pip install seleniumbase实现获取代码脚本文件见 free-crunchbase-scraper/crunchbase-scraper.py插入资源包将下载的脚本文件和相关资源包如配置文件、依赖文件等放置到你的项目目录中。确保所有文件在同一目录下或正确配置文件路径。设置目标 URL打开脚本并将target_url修改为你要抓取的 Crunchbase 公司页面。target_urlhttps://www.crunchbase.com/organization/your-target-company运行脚本在终端执行python crunchbase-scraper.py 说明该脚本使用 SeleniumBase先进的 Selenium 封装内置多种能力以处理验证码与其他浏览器挑战。延伸阅读使用 SeleniumBase 进行网页抓取 与 SeleniumBase 搭配代理。示例输出脚本会以如下结构化格式提取数据{ description: Bright Data offers a platform for ethical web data collection and analysis., website_url: [https://www.bright.cn](https://www.bright.cn/), founding_date: 2018-07-01, email: [salesbrightdata.com](mailto:salesbrightdata.com), phone: (888) 538-9204, company_overview: Bright Data is a data collection platform that helps businesses gather publicly available web data..., headquarters_location: New York, United States, North America, operating_status: active, employee_count: 251-500, founder_names: [ Derry Shribman, Ofer Vilenski ], industry_categories: [ Business Intelligence, Cloud Data Services, /* ... */ ] }重要限制与挑战该方式会遇到诸多网页抓取挑战使其不适合生产级数据采集IP 封禁与速率限制Crunchbase 会监控并限制来自同一 IP 的请求。尝试抓取不久后你的 IP 很可能被封。复杂的反爬机制包括验证码如 Cloudflare Turnstile与行为分析专门用于识别并阻断自动化脚本。动态站点结构Crunchbase 经常更新页面布局与代码任何变化都可能导致脚本失效并需要持续维护。可扩展性问题难以高效处理多 URL 或大批量数据。维护成本高需自管基础设施、应对封禁、更新脚本并确保合规。2. Bright Data Crunchbase 爬虫 APIBright Data Crunchbase 爬虫 API 提供稳健、可扩展、低门槛的方式无需处理抓取复杂性即可从 Crunchbase 提取全面数据。关键优势规避技术难题基于高级代理轮换与解封技术自动处理 IP 封禁、验证码与限流企业级扩展性为大规模数据采集而设计高可靠性企业级可用性与稳定的数据交付友好易用简洁 API 集成免去自研与维护成本结构化输出提供清洗、规范化的数据开箱即用合规遵循包括 GDPR、CCPA 在内的数据隐私法规弹性计费按成功交付计费专属支持7×24 专家技术支持接入形态可通过 API 或 零代码爬虫 使用开始使用创建账号注册 Bright Data 账号新增支付方式后新用户获 $5 赠金生成 API Token在控制台获取你的API 密钥实施指南API 与零代码两种方式的详细配置步骤见setup-bright-data-crunchbase-scraper.mdAPI 方法该 API 提供两种主要采集方式A. 通过 URL 采集 Crunchbase 数据针对指定的 Crunchbase 公司页面返回完整的档案信息。输入参数参数必填描述url是Crunchbase 公司页面完整 URL示例请求Pythonconfig{api_token:YOUR_API_TOKEN,# 替换为你的实际 Tokenorganizations:[{url:https://www.crunchbase.com/organization/apple},{url:https://www.crunchbase.com/organization/brightdata},],output_file:crunchbase-company-profiles.json,# 可选自定义输出文件名}# ... 脚本后续使用该 config将YOUR_API_TOKEN替换为你的 Bright Data API Token修改organizations列表为你的目标 Crunchbase URL可运行完整脚本见crunchbase-scraper-api/crunchbase-profile-fetcher.py示例请求cURLcurl-XPOST\https://api.brightdata.com/datasets/v3/trigger?dataset_idgd_l1vijqt9jfj7olijeinclude_errorstrue\-HAuthorization: Bearer YOUR_API_TOKEN\-HContent-Type: application/json\-d[{url:https://www.crunchbase.com/organization/apple},{url:https://www.crunchbase.com/organization/brightdata}]示例输出片段API 返回全面且结构化的数据。以下为单个公司的部分字段示例{ companyName: Bright Data, legalName: Bright Data, website: https://www.bright.cn, description: Offers a platform for ethical web data collection and analysis..., foundedDate: 2014-01-01, location: {city: New York, state: New York, country: United States}, companyType: For-Profit, operatingStatus: Active, ipoStatus: Private (Acquired), employeeSizeRange: 251-500, industries: [Business Intelligence, Cloud Data Services, ...], keyPersonnel: { ceo: {name: Or Lenchner, ...: ...}, founders: [{name: Derry Shribman, ...: ...}, {name: Ofer Vilenski, ...: ...}] }, webTraffic: {monthlyVisits: 865525, source: Semrush, ...: ...}, technology: {activeTechCount: 19, exampleTechUsed: [Cloudflare Hosting, ...]}, products: {totalActive: 23, exampleProductNames: [Residential Proxies, ...]}, acquisitionDetails: {acquiredBy: EMK Capital, priceUSD: 200000000, ...: ...}, intellectualProperty: {patentsGranted: 199, trademarksRegistered: 18} // Additional data fields available }完整示例响应见crunchbase-data/crunchbase-company-profiles.jsonB. 按关键词发现 Crunchbase 数据根据关键词或行业如 “AI”“Venture Capital”“SaaS”发现相关公司。输入参数参数必填描述keyword是用于搜索相关公司的关键词示例请求Pythonconfig{api_token:YOUR_API_TOKEN,# 替换为你的实际 Tokenkeywords:[{keyword:AI},{keyword:Venture Capital},{keyword:SaaS}# 可按需添加更多关键词],output_file:crunchbase-keyword-results.json,# 可选自定义输出文件名}# ... 脚本将使用该 config 调用 API替换YOUR_API_TOKEN修改keywords列表可运行完整脚本见crunchbase-scraper-api/crunchbase-keyword-search.py示例请求cURLcurl-XPOST\https://api.brightdata.com/datasets/v3/trigger?dataset_idgd_l1vijqt9jfj7olijeinclude_errorstruetypediscover_newdiscover_bykeyword\-HAuthorization: Bearer YOUR_API_TOKEN\-HContent-Type: application/json\-d[{keyword:AI},{keyword:Venture Capital}]示例输出片段响应将包含与关键词匹配的多家公司数据。以下展示其中一个结果的结构{ companyName: Airbus, // 例如匹配关键字 AI 的结果 legalName: Airbus Defense and Space Holdings, Inc., website: https://us.airbus.com, description: Airbus designs, manufactures, and delivers aerospace products..., foundedDate: 2014-01-01, location: { city: Herndon, state: Virginia, country: United States }, companyType: For-Profit, operatingStatus: Active, ipoStatus: Private, employeeSizeRange: 10001, industries: [ Aerospace, Commercial, Manufacturing ], // ... 还包含与“按 URL 采集”方法类似的丰富字段 }完整示例响应见crunchbase-data/crunchbase-keyword-results.jsonAPI 配置与交付选项你可以在 API 请求中通过以下参数自定义任务参数类型描述示例limitinteger限制每个输入URL 或关键词的最大返回条数limit50include_errorsboolean返回结果中包含详细错误信息便于排查include_errorstrueformatenum输出格式json、csv、ndjsonformatcsvnotifyurl任务完成后回调通知的 Webhook 地址notifyhttps://...数据可直接投递至你偏好的外部存储或通过 Webhook 交付。关于 Web Scraper API 与触发任务的完整文档参见Bright Data Web Scraper API 文档触发采集 API 参考零代码爬虫界面若你偏好可视化、点选式的配置方式Bright Data 还提供 No-Code Scraper。基于同样强大的底层基础设施你无需写代码即可配置并启动 Crunchbase 采集任务。参见设置指南。备选方案预采集的 Crunchbase 数据集若你需要即时获取大量结构化 Crunchbase 数据、且不希望自行运行采集任务可考虑 Bright Data 的预采集Crunchbase 数据集。即取即用即时访问已验证、结构化的数据覆盖全面单个公司档案包含 100 数据点定期更新可选日更、周更、月更或自定义灵活购买可购买全量或按需子集匹配预算与需求易于集成支持 API 或直接下载支持样本可申请样本评估数据质量与契合度资源与支持Bright Data 文档Crunchbase 爬虫 API 产品页Web Scraper API 文档API 参考触发采集数据集产品页获取 API Token指南与博文如何抓取 Crunchbase全面指南不被封的网页抓取方法本仓库中的 Bright Data Crunchbase 爬虫设置指南技术支持通过账号控制台 7×24 联系支持或发送邮件至 supportbrightdata.com