一次 API 请求,将整个网站转为 LLM 可用数据

通过代理驱动的抓取引擎,将任意网站转为干净、结构化的数据:Markdown、HTML、链接和 PDF。专为构建 RAG 流程、市场研究与数据产品的开发者和 AI 团队打造。

  • 99.8% 成功率
  • 已处理 1000 万+ 页面
  • 支持 Markdown/JSON/HTML/PDF 输出
免费
Crawl // 网站转数据

从一个 URL 到完整、可供 LLM 使用的数据集。

Crawl 从目标 URL 开始,发现可访问页面,应用渲染与代理规则,然后为任务中的每个页面返回标准化输出。

  • 可扩展
  • 可控制
  • 结构化

站点发现

从站点地图、页面链接和自定义子页面规则中发现所有可抓取 URL,不遗漏页面。

递归抓取

在抓取开始前控制最大页数、深度与排除路径。

JavaScript 渲染

在提取内容前,使用真实浏览器渲染动态、重度依赖 JS 的页面。

Crawl API

从 Playground 生成可直接使用的代码,并从你的应用中运行抓取任务。

数据输出

查看抓取记录、检查结果,并一键导出干净数据。

团队隔离

按账户或团队隔离抓取记录、订阅额度和使用情况。

代理驱动访问

使用住宅、数据中心或自定义代理,更可靠地访问页面。

灵活格式

从同一抓取流程返回 Markdown、HTML、JSON、链接和 PDF。

Crawl 如何工作

面向需要可重复、全站数据采集的数据团队和开发者,无需维护爬虫基础设施。

01

提交目标 URL

从网站、文档中心或产品目录开始。

02

设置抓取边界

定义深度、最大页数、包含/排除规则与请求选项。

03

渲染并路由

启用 JavaScript 渲染,并通过 Nstdata 或自定义代理路由流量。

04

导出页面数据

接收每个页面干净、结构化的输出,直接用于你的数据流程。

通过可视化界面或 API 使用 Crawl。

先在 Playground 中测试参数,再复制与相同抓取配置匹配的 API 示例。

先用 Playground

无需写代码即可尝试 URL、JS 渲染、代理选项和输出格式。

可直接使用的示例

复制根据当前设置生成的 Node.js、cURL 或 SDK 代码片段。

感知用量

Crawl 会优先使用订阅额度,再在需要时使用充值额度。

查看示例
import os
from nstdata_ai_crawl import CrawlRequestDto, Format, NstDataClient

with NstDataClient(os.environ["NSTDATA_API_TOKEN"]) as client:
    crawl = client.submit_crawl_task(CrawlRequestDto(
        url="https://docs.example.com/",
        maxDepth=3,
        maxPages=10,
        formats=[Format.MARKDOWN],
        onlyMainContent=True,
        timeout=60000,
    ))

    print("crawl task id:", crawl.id)

简单且高性价比的代理基础设施

Pay per use

Free

$0

$1.80 / GB 住宅代理
$1.20 / 1k URLs Crawl
无包含额度

Small Projects

Starter

$79/

$1.60 / GB 住宅代理
$1.00 / 1k URLs Crawl
$79 包含额度
推荐

Growth

$249/

$1.30 / GB 住宅代理
$0.80 / 1k URLs Crawl
$0.15 / GB 代理管理器
$249 包含额度

High Volume

Scale

$699/

$1.10 / GB 住宅代理
$0.60 / 1k URLs Crawl
$0.10 / GB 代理管理器
$699 包含额度

为全站数据工作流打造

当一个 URL 需要变成大量干净、结构化、可复用的数据页面时,就使用 Crawl。

文档转知识库

抓取文档网站,并将每个页面转为干净 Markdown,服务 AI 与支持工作流。

商品目录采集

从电商网站采集分类页、商品详情、价格、库存和链接。

研究与监测

监测公开网站,并将原始页面转为可重复使用的研究输入。

SEO 与内容审计

抓取域名以收集元数据、内部链接、页面内容和抓取覆盖情况。

AI 数据管道

将抓取的 Markdown 和 JSON 输入 RAG、智能体、索引和数据增强工作流。

页面存档

保存 HTML 和 PDF 输出,用于审查、记录、合规和可重复审计。

常见问题

关于 Crawl、定价和技术集成,你需要了解的一切。

Crawl 可为每个已处理页面返回干净的 Markdown、HTML、JSON、链接和 PDF 输出。

Nstdata

Crawl

使用 Nstdata 的代理驱动抓取引擎,将任意网站转为干净、可供 LLM 使用的数据。免费开始,无月度最低消费,只为实际抓取付费。

Nstdata 标识©2026 NST LABS TECH LTD. 保留所有权利。