Nstdata Crawl: API thu thập dữ liệu web powered by AI cho dữ liệu sẵn sàng cho LLM
Giới thiệu
Các trang web là một trong những nguồn kiến thức lớn nhất và thường xuyên được cập nhật nhất có sẵn cho các ứng dụng AI. Các tác nhân AI sử dụng chúng để nghiên cứu các công ty và thị trường. Các hệ thống tạo ra dữ liệu tăng cường truy xuất (RAG) sử dụng chúng để xây dựng các cơ sở dữ liệu có thể tìm kiếm. Các đội dữ liệu sử dụng chúng để theo dõi giá cả, danh mục sản phẩm, bảng xếp hạng tìm kiếm, tin tức và các thay đổi trong kinh doanh.
Tuy nhiên, việc lấy dữ liệu đáng tin cậy từ web hiện đại không còn đơn giản như việc gửi một yêu cầu HTTP và phân tích phản hồi. Nhiều trang web hiện hiển thị nội dung của họ bằng JavaScript, tải thông tin không đồng bộ, kích hoạt nội dung thông qua cuộn hoặc nhấp chuột, và sử dụng các hệ thống kiểm soát rủi ro tinh vi để xác định lưu lượng truy cập tự động. Ngay cả khi một trang đã được truy xuất, HTML của nó thường chứa đầy các yếu tố không liên quan đến mô hình AI như điều hướng, tập lệnh, kiểu dáng, quảng cáo và các yếu tố khác.
Nstdata Crawl là một API quét web được hỗ trợ bởi AI, biến các trang web thành dữ liệu sạch, có cấu trúc, sẵn sàng cho LLM. Các nhà phát triển gửi một URL và chọn đầu ra cần thiết. Nstdata Crawl xử lý truy cập trang, hiển thị trình duyệt, định tuyến proxy, xác thực trình duyệt, thử lại, trích xuất nội dung, chuyển đổi định dạng và quản lý tác vụ chỉ qua một API.
Thay vì duy trì một trình quét khác nhau cho mỗi trang web, các nhóm có thể sử dụng Nstdata Crawl như một lớp dữ liệu web dùng lại trên các tác nhân AI, quy trình RAG, hệ thống phân tích và ứng dụng doanh nghiệp.
Vấn đề với việc Trích xuất Dữ liệu Web ngày nay — Tại sao Chúng tôi Xây dựng Nstdata Crawl
Lấy một trang web từng là một yêu cầu HTTP một dòng. Giờ đây thì không còn như vậy nữa.
Hầu hết web hiện đại được hiển thị từ phía khách hàng, bị chặn bởi các hệ thống chống bot ngày càng tinh vi hơn và được cấu trúc theo cách làm cho các mô hình ngôn ngữ khó đọc trực tiếp. Một nhóm quyết định "chỉ quét một vài trang" cho một tác nhân AI hoặc quy trình RAG sẽ nhanh chóng thấy mình phải xây dựng:
Một cụm trình duyệt không giao diện cho các trang được hiển thị bằng JavaScript
Luật thử lại và thời gian chờ cho các trang nứt nẻ và lỗi mạng
Dọn dẹp nội dung để loại bỏ quảng cáo, điều hướng và các mẫu không cần thiết
Chuyển đổi HTML sang Markdown để một LLM thực sự có thể sử dụng đầu ra
Lập lịch đồng thời và theo dõi lỗi ở quy mô lớn
Không có gì trong số đó là sản phẩm. Đó là thuế bạn phải trả trước khi bạn bắt đầu xây dựng sản phẩm. Chúng tôi đã xây dựng Nstdata Crawl vì chúng tôi thường xuyên thấy cùng một mô hình: các nhóm xây dựng các ứng dụng AI thực sự thú vị nhưng lại bị mắc kẹt trong việc duy trì cơ sở hạ tầng quét.
Ba điều đã thuyết phục chúng tôi rằng vấn đề này cần được giải quyết một lần, đúng cách, như một cơ sở hạ tầng:
Việc quét đã âm thầm trở thành một vấn đề hạ tầng, không phải là một nhiệm vụ lập trình. Các nhà phát triển xây dựng các tác nhân AI và hệ thống RAG đã dành quá nhiều thời gian cho việc điều phối trình duyệt không giao diện, định tuyến proxy và xử lý CAPTCHA — thời gian lẽ ra nên dành cho thiết kế prompt, chất lượng truy xuất và logic sản phẩm.
Có một khoảng cách thực sự giữa những gì các trình quét truyền thống tạo ra và những gì AI cần. Hầu hết các công cụ quét được xây dựng cho SEO hoặc lưu trữ đơn giản, và chúng cung cấp lại HTML "bẩn" — đầy các tập lệnh, quảng cáo và tiếng ồn đánh dấu. Cung cấp điều đó cho một LLM và bạn đang trả thêm token cho nội dung thực sự làm tổn hại khả năng của mô hình trong việc hiểu trang.
Các biện pháp chống bot đã chuyển sang mức độ dấu vân tay trình duyệt. Các trang web không chỉ lọc theo IP — chúng kiểm tra việc hiển thị Canvas, thuộc tính WebGL, dấu vân tay phông chữ và đặc điểm phần cứng để phát hiện tự động hóa. Một trình quét với dấu vân tay không nhất quán hoặc không đầy đủ sẽ bị chặn trước khi nó thậm chí thấy nội dung.
Nstdata Crawl giải quyết cả ba vấn đề này cùng một lúc: nó hiển thị các trang như một trình duyệt thực sự, làm sạch nội dung xuống đúng những gì LLM thực sự cần, và chạy trên một nền tảng dấu vân tay trình duyệt được xây dựng để chịu đựng chính xác loại phát hiện này — vì vậy ứng dụng của bạn không bao giờ phải chạm vào bất kỳ điều gì trong số đó.
Nstdata Crawl là gì?
1. Tổng quan về Nstdata Crawl
Nstdata Crawl là một API quét web hiệu suất cao dành cho các nhà phát triển và đội dữ liệu. Nó chuẩn hóa quy trình thu thập dữ liệu web đầy đủ dưới dạng một dịch vụ cắm và chạy.
Khi có một URL mục tiêu, API có thể truy xuất và hiển thị trang, trích xuất nội dung chính của nó và trả lại dữ liệu có thể được sử dụng trực tiếp bởi một mô hình AI hoặc hệ thống doanh nghiệp. Nó hỗ trợ quét một trang chính xác, xử lý không đồng bộ cho các tác vụ dài hơn, và quét cấp trang web với độ sâu, giới hạn trang và quy tắc URL có thể cấu hình.
Tại lớp truy cập, Nstdata Crawl kết hợp công nghệ dấu vân tay trình duyệt với hạ tầng proxy của Nstdata để mô phỏng một môi trường duyệt web thực tế. Tại lớp giao hàng, nó hỗ trợ Markdown, HTML đã được làm sạch, dữ liệu trang thô, liên kết, ảnh chụp màn hình và PDF. Việc hiển thị, làm sạch, thử lại, lập lịch và lưu trữ kết quả được xử lý bởi dịch vụ, vì vậy các ứng dụng tích hợp với một giao diện nhất quán thay vì một tập hợp các tập lệnh quét dễ bị hỏng.
Trong các điều khoản thực tế, Nstdata Crawl có thể đóng vai trò là:
một công cụ đọc web cho các tác nhân AI;
lớp thu thập và làm sạch của một quy trình RAG;
một công cụ giám sát trang web cho giá cả, sản phẩm và thay đổi thị trường;
một backend thu thập dữ liệu được quản lý cho các nền tảng dữ liệu và ứng dụng nội bộ.
Tóm lại: Nstdata Crawl là lớp giữa "một URL" và "dữ liệu mà hệ thống AI của bạn có thể sử dụng" — để bạn có thể ngừng duy trì các tập lệnh thu thập dữ liệu và gọi một điểm cuối thay vào đó.
2. Các Tính Năng Chính của Nstdata Crawl: Từ URL đến Dữ Liệu Web Sẵn Sàng Sản Xuất
Nstdata Crawl kết hợp các khả năng thường được phân bố qua một khách hàng HTTP, cụm trình duyệt, bể proxy, quy trình trích xuất, hàng đợi công việc và kho chứa vật phẩm. Các nhà phát triển kiểm soát quy trình làm việc thông qua các tham số API và nhận đầu ra nhất quán bất kể cấu trúc trang nền tảng.
1. API Thu Thập Dữ Liệu Thân Thiện với Nhà Phát Triển
Dịch vụ này cung cấp một API REST tiêu chuẩn cho toàn bộ quy trình từ cấu hình yêu cầu đến thu thập kết quả. Một yêu cầu duy nhất có thể chỉ định URL mục tiêu, định dạng đầu ra, thời gian chờ, trích xuất nội dung chính, phạm vi thu thập và các tùy chọn thực thi khác.
Việc thu thập đồng bộ trả lại kết quả trong yêu cầu khi trang hoàn thành trong một khoảng thời gian có thể dự đoán. Việc thu thập không đồng bộ ngay lập tức trả lại một ID tác vụ, cho phép ứng dụng kiểm tra trạng thái và thu thập kết quả sau. Thu thập ở cấp độ trang web bắt đầu từ một URL đầu vào và khám phá các trang nội bộ theo độ sâu, số trang, các quy tắc bao gồm và loại trừ rõ ràng.
SDK chính thức có sẵn cho Node.js, Python và Go, giúp tích hợp Crawl vào các dịch vụ, tập lệnh, công cụ tác nhân và quy trình dữ liệu hiện có trở nên đơn giản.
2. Trích Xuất Markdown và Dữ Liệu Cấu Trúc Sẵn Sàng cho AI
Nstdata Crawl không chỉ tải xuống một trang web. Nó có thể phân tích cấu trúc trang, tách nội dung chính, loại bỏ các yếu tố làm phân tâm và chuyển đổi kết quả thành Markdown sạch.
Markdown giữ lại tiêu đề, đoạn văn, danh sách và liên kết mà không cần khối lượng thẻ, kiểu dáng và tập lệnh có trong HTML thô. Điều này khiến nó trở thành một mặc định mạnh mẽ cho các lời nhắc LLM, phản hồi từ công cụ tác nhân, tiếp nhận RAG, tóm tắt, phân loại và trích xuất cấu trúc. Tùy chọn onlyMainContent có thể giảm thêm điều hướng, quảng cáo, tiêu đề, chân trang và các yếu tố bố cục lặp lại khác.
Đối với các quy trình làm việc yêu cầu cấu trúc DOM hoặc phân tích tùy chỉnh, API cũng có thể trả lại HTML đã được làm sạch, dữ liệu thô, liên kết và siêu dữ liệu trang cấu trúc như tiêu đề, ngôn ngữ và trạng thái HTTP.
3. Kết Xuất JavaScript cho Các Trang Web Hiện Đại
Một phần lớn của web hiện đại - các trang React, Vue và Next.js, trang giá cả, danh sách sản phẩm, bảng việc làm - đơn giản không tồn tại trong phản hồi HTML ban đầu. Nstdata Crawl mở trang trong một môi trường trình duyệt thực, chờ cho đến khi nó hoàn thành việc kết xuất, và chỉ sau đó mới trích xuất nội dung, vì vậy bạn thấy những gì một du khách thực sự sẽ thấy.
Bạn có quyền kiểm soát chi tiết hơn về cách mà thời gian chờ hoạt động:
Chờ một bộ chọn CSS (ví dụ: main, article, .content, #app) đến khi việc trích xuất chỉ xảy ra khi nội dung thực đã được gắn — không phải là một khung tải.
Cấu hình thời gian chờ bổ sung cho các phản hồi API chậm, hoạt ảnh, hoặc các phần tải chậm.
Tổ chức các hành động trên trình duyệt — nhấp vào "tải thêm", cuộn để kích hoạt tải chậm, điền vào một trường biểu mẫu, chạy JavaScript tùy chỉnh, hoặc chờ cho một yêu cầu mạng cụ thể hoàn thành — trước khi việc trích xuất diễn ra.
4. Dấu Vân Tay Trình Duyệt và Hạ Tầng Proxy
Các hệ thống kiểm soát truy cập hiện đại đánh giá nhiều hơn cả danh tiếng IP. Chúng cũng có thể kiểm tra các dấu vân tay TLS và trình duyệt, các đặc điểm của thiết bị, thuộc tính kết xuất, phông chữ, hành vi Canvas, các tham số phần cứng và các thuộc tính WebGL.
Nstdata Crawl sử dụng một kiến trúc trình duyệt dấu vân tay để tạo ra một môi trường duyệt web đồng nhất hơn. Nó làm việc trực tiếp với hạ tầng proxy của Nstdata, cho phép xoay vòng proxy và nhắm mục tiêu địa lý mà không yêu cầu các nhà phát triển phải vận hành riêng các bể proxy của họ.
Sự tích hợp chặt chẽ giữa động cơ thu thập và tài nguyên proxy đặc biệt hữu ích cho các khối lượng công việc kinh doanh lâu dài và có lưu lượng lớn. Khi các điều kiện truy cập thay đổi, các lớp thu thập và proxy nền tảng có thể được cập nhật mà không yêu cầu khách hàng viết lại mã thu thập dữ liệu ở cấp độ ứng dụng.
5. Thu Thập Đáng Tin Cậy với Quản Lý Thử Lại và Tác Vụ
Việc thu thập dữ liệu sản xuất thường gặp phải các lỗi tạm thời — các trang chậm, mạng không ổn định, proxy tạm thời không khả dụng. Nstdata Crawl xử lý vấn đề này ở cấp độ hạ tầng:
Tự động thử lại khi xảy ra các lỗi có thể khôi phục, dựa trên trạng thái tác vụ và loại lỗi — mà không cần bạn viết logic thử lại.
Thời gian chờ có thể cấu hình cho mỗi tác vụ, để một trang chậm đơn lẻ không bao giờ chặn quy trình của bạn; sử dụng thời gian chờ ngắn cho các trang đơn giản và lâu hơn cho các trang nặng JS hoặc phản hồi chậm.
Các truy vấn trạng thái tác vụ theo ID, để bạn có thể kiểm tra xem một công việc đang xử lý, đã hoàn thành, hoặc thất bại.
Chế độ đồng bộ hoặc không đồng bộ — chờ một kết quả ngay lập tức, hoặc gửi và kiểm tra sau cho các trang chạy lâu, thu thập sâu, hoặc các công việc theo nhóm.
Giám sát tiến trình lô cho các cuộc thu thập cấp site — tổng số, hoàn thành, đang chờ và số lượng thất bại, với kết quả phân trang trên mỗi trang để theo dõi và phân tích lỗi.
6. Thu thập có thể mở rộng cho khối lượng công việc doanh nghiệp
Nstdata Crawl được xây dựng để chạy nhiều tác vụ cùng một lúc, không chỉ một lần. Các tác vụ được phân phối qua một hàng đợi nhận thức về độ ưu tiên, do đó các công việc nhạy cảm về thời gian được ưu tiên hơn các công việc thường nhật trong khi lưu lượng bình thường vẫn được xử lý theo thứ tự ổn định. Các giới hạn tốc độ được áp dụng theo cấp độ kế hoạch để bảo vệ cả các trang web mục tiêu của bạn và hạ tầng chia sẻ khỏi bị quá tải.
Kết hợp với việc thanh toán dựa trên mức sử dụng trên các cấp độ miễn phí, Starter, Growth, và Scale, điều này có nghĩa là cùng một API có thể mở rộng từ một nhà phát triển thử nghiệm một nguyên mẫu đến một đội ngũ doanh nghiệp chạy các khối lượng công việc thu thập lớn, liên tục — mà không cần thay đổi công cụ hay kiến trúc lại bất cứ điều gì khi việc sử dụng tăng.
3. Mô hình định giá
Nstdata Crawl tính phí chủ yếu theo yêu cầu thành công / hiển thị trang, không theo các lượt thử:
Một yêu cầu được tính phí khi nội dung trang thực sự được truy xuất (một mã trạng thái HTTP được nhận mà không có lỗi mạng — điều này bao gồm cả các trường hợp như 404/403, mà vẫn được tính như một lượt truy xuất thành công).
Băng thông được tính phí dựa trên lưu lượng thực tế tiêu thụ.
Nếu nội dung không được truy xuất do vấn đề từ phía hệ thống, bạn sẽ không bị tính phí.
Việc hiển thị JavaScript, trích xuất Markdown, xuất PDF và chụp màn hình đều được bao gồm trong dịch vụ cơ bản — không có các khoản tính phí riêng biệt. Lưu lượng proxy được tính phí độc lập dựa trên mức sử dụng.
Cấp độ
Tốt nhất cho
Những gì bạn nhận được
Dùng thử miễn phí
Xác thực chức năng, tạo mẫu
$1 USD trong tín dụng dùng thử khi đăng ký
Trả tiền theo mức sử dụng
Không cam kết, sử dụng biến động
$1.2 / 1.000 yêu cầu, không có đăng ký
Starter
Các đội ngũ giai đoạn đầu, khối lượng thấp
Tính đồng thời cơ bản, giá proxy tiêu chuẩn
Growth
Các đội ngũ mở rộng, tần suất cao hơn
Tính đồng thời cao hơn, giá proxy tốt hơn, độ ưu tiên hàng đợi nâng cao
Scale
Tính đồng thời cao, thông lượng cao, doanh nghiệp
Tính đồng thời tối đa, tỷ lệ proxy cạnh tranh nhất, độ ưu tiên hàng đợi hàng đầu
Doanh nghiệp
Yêu cầu tùy chỉnh
Hợp đồng và định giá theo yêu cầu
Không cần đăng ký để bắt đầu — đăng ký, nhận tín dụng dùng thử, và chuyển sang trả tiền theo mức sử dụng bất cứ khi nào bạn sẵn sàng.
4. Định dạng đầu ra
Nstdata Crawl có thể trả về những biểu diễn khác nhau của cùng một trang, cho phép mỗi hệ thống hạ nguồn sử dụng định dạng phù hợp nhất.
Định dạng
Tốt nhất cho
Đặc điểm
Markdown
Lời nhắc LLM, AI agents, RAG, tóm tắt, trích xuất
Văn bản ngữ nghĩa sạch với ít token không cần thiết hơn so với HTML
HTML
Phân tích DOM, tái tạo trang, phân tích bảng và liên kết
Bảo toàn cấu trúc HTML trong khi hỗ trợ làm sạch dựa trên bộ chọn
Dữ liệu thô
Gỡ lỗi, phân tích tùy chỉnh, ảnh chụp, phân tích mã hóa
Giữ lại dữ liệu trang gốc đầy đủ nhất nhưng có thể chứa các script và tiếng ồn
Chụp màn hình
Xác minh hình ảnh, giám sát trang, kiểm toán, bằng chứng
Nắm bắt trạng thái hình ảnh đã được hiển thị sau khi thực hiện JavaScript và các hành động của trình duyệt
PDF
Lưu trữ, xem ngoại tuyến, báo cáo, hồ sơ tuân thủ
Bảo toàn một biểu diễn trang di động sau khi hiển thị
Kết quả lớn có thể được trả về dưới dạng token tham chiếu, bao gồm markdownRef, htmlRef, rawDataRef, screenshotRef, hoặc pdfRef. Tài liệu hoàn chỉnh có thể được lấy qua điểm cuối lưu trữ:
GET /api/v1/crawl/storage/read?st={ref}
Cách Nstdata Crawl Hoạt Động
Một yêu cầu thu thập trải qua bảy giai đoạn:
Gửi — Ứng dụng gửi một URL, định dạng đầu ra, và các tùy chọn thu thập.
Xác thực — Nstdata Crawl xác thực quyền truy cập, trường yêu cầu, URL mục tiêu, và giới hạn tài khoản.
Lập lịch — Tác vụ được đưa vào một hàng đợi được quản lý theo loại khối lượng công việc và độ ưu tiên.
Truy cập và hiển thị — Dịch vụ chọn môi trường thu thập, áp dụng cài đặt proxy và dấu vân tay, tải trang, và thực hiện JavaScript hoặc các hành động trên trình duyệt khi cần.
Trích xuất và chuyển đổi — Bộ máy xác định nội dung được yêu cầu và chuyển đổi nó thành Markdown, HTML, dữ liệu thô, một chụp màn hình, một PDF, hoặc các liên kết.
Lưu trữ và cung cấp — Kết quả nhỏ có thể được trả về ngay trong dòng. Các đầu ra lớn được lưu trữ và trả về thông qua các token tham chiếu.
Giám sát — Các yêu cầu đồng bộ trả về một kết quả hoàn thành trực tiếp. Các công việc không đồng bộ và cấp site tiết lộ trạng thái tác vụ và các điểm cuối tiến trình.
Quy trình làm việc chung này cho phép một ứng dụng xử lý một bài viết tĩnh, một trang sản phẩm động, và một toàn bộ phần tài liệu qua cùng một dịch vụ.
Đăng ký tại nstdata, yêu cầu tín dụng dùng thử hoặc thêm số dư trả theo từng lần sử dụng, và sao chép khóa API từ trang tài khoản hoặc sân chơi thu thập dữ liệu.
Yêu cầu sau đây chuyển đổi https://example.com thành Markdown:
Một phản hồi thành công chứa trạng thái nhiệm vụ, Markdown, một mã tham chiếu, và siêu dữ liệu trang:
{"data":{"code":0,"data":{"markdown":"# Example Domain\n\nMiền này được sử dụng cho các ví dụ tài liệu.","markdownRef":"REFERENCE_TOKEN","metadata":{"language":"en","statusCode":200,"title":"Example Domain"}},"status":"completed","success":true},"err":false,"msg":"SUCCESS","code":200}
Lưu khóa trong biến môi trường hoặc máy quản lý bí mật. Đừng tiết lộ nó trong mã phía trình duyệt hoặc cam kết nó vào một kho lưu trữ.
Ví Dụ Về API
Tất cả các yêu cầu API Nstdata Crawl yêu cầu một khóa API được truyền trong tiêu đề yêu cầu. Bạn có thể tìm thấy khóa API của mình trong bảng điều khiển tài khoản sau khi đăng ký.
URL cơ sở cho tất cả các điểm cuối là https://api.nstdata.io. Lưu khóa API của bạn trong một biến môi trường — đừng bao giờ tiết lộ nó trong mã phía khách hàng hoặc cam kết nó vào một kho lưu trữ.
1. 3 Chế Độ Thu Thập Dữ Liệu
Thu Thập Dữ Liệu Một Trang
Thu thập dữ liệu một trang lấy một URL được chỉ định và trả lại nội dung dưới một hoặc nhiều định dạng đầu ra: Markdown, HTML, liên kết, ảnh chụp màn hình, PDF, hoặc dữ liệu thô. Sử dụng điểm cuối này khi quy trình làm việc của bạn xử lý các trang riêng lẻ — trích xuất bài viết, giám sát trang sản phẩm, tiếp nhận tài liệu, hoặc đọc web theo thời gian thực của Agent.
Hai chế độ gửi có sẵn tùy thuộc vào việc ứng dụng của bạn cần kết quả ngay lập tức hay có thể kiểm tra để hoàn thành:
Thu Thập Dữ Liệu Đồng Bộ
Điểm cuối đồng bộ chờ nhiệm vụ hoàn thành và trả lại kết quả trực tiếp trong phản hồi. Sử dụng chế độ này cho các trang đơn lẻ với thời gian xử lý có thể dự đoán, nơi người gọi cần kết quả ngay lập tức — các cuộc gọi công cụ Agent theo thời gian thực, trích xuất nội dung theo yêu cầu, hoặc quy trình làm việc tương tác.
{"code":200,"err":false,"msg":"success","data":{"code":0,"success":true,"status":"completed","data":{"markdown":"# Example Domain","markdownRef":"xxx","links":["https://www.iana.org/domains/example"],"metadata":{"title":"Example Domain","statusCode":200,"language":"en"}}}}
Đừng chỉ dựa vào mã trạng thái HTTP để xác định xem việc thu thập dữ liệu có thành công hay không. Luôn kiểm tra success, status, và data trong thân phản hồi — mã HTTP 200 có nghĩa là yêu cầu đã được nhận, không phải là trang đã được lấy thành công.
Thu Thập Dữ Liệu Bất Đồng Bộ
Điểm cuối bất đồng bộ trả về một ID nhiệm vụ ngay lập tức và xử lý trang ở nền. Sử dụng chế độ này cho các trang nặng JavaScript với thời gian kết xuất dài, các trang phía sau mạng chậm, hoặc bất kỳ quy trình làm việc nào không nên giữ kết nối HTTP mở trong khi chờ kết quả.
Lấy kết quả bằng cách kiểm tra với ID nhiệm vụ đã trả về:
GET /api/v1/crawl/scrape/{taskId}
2. Thu Thập Dữ Liệu Cấp Trang
Thu thập dữ liệu cấp trang bắt đầu từ một URL đầu vào và tự động phát hiện và xử lý các trang nội bộ trong các ranh giới đã được cấu hình. Sử dụng điểm cuối này để tiếp nhận các trang tài liệu, danh mục sản phẩm, các phần nội dung đối thủ, hoặc bất kỳ tập hợp nội dung có cấu trúc nào mà danh sách URL đầy đủ không được biết trước.
Luôn đặt ranh giới rõ ràng trước khi gửi việc thu thập dữ liệu cấp trang. Nếu không có maxDepth, maxPages, và các quy tắc loại trừ, việc thu thập dữ liệu có thể mở rộng thành các trang tìm kiếm, URL phân trang, quy trình đăng nhập, và tải xuống tệp — tiêu tốn ngân sách và thời gian cho nội dung bạn không cần.
Sử dụng ID thu thập được để kiểm tra tiến độ và lấy kết quả trang.
3. Truy vấn Trạng thái và Kết quả Nhiệm vụ
Truy vấn Kết quả Thu thập Một Trang
Trả về trạng thái nhiệm vụ, cờ thành công và dữ liệu kết quả cho nhiệm vụ thu thập một trang. Đối với kết quả lớn, phản hồi có thể chứa các mã tham chiếu thay vì nội dung trong dòng — xem phần bên dưới về việc đọc kết quả lớn.
GET /api/v1/crawl/scrape/{taskId}
Ví dụ phản hồi
{"data":{"code":0,"data":{"markdownRef":"nL9gU9mOz9uHEtfXObDTo8K2wPh3F0ekLeDT_-NR-0Bl3-yl2_1kKY16Vbjy3Nj1nPpGK5o9GYnnSvAZqZxNRgrhgKuHrBS9JK4YgQHb0wYBUv20","metadata":{"language":"en","statusCode":200,"title":"Tên miền ví dụ"},"rawDataRef":"GTZQPXe-_oEWhBvlN1ZbOJt1unITySNEjb1QzVgv_FKTHVJrOe1h59O_hwVB2MaO98nq-V4EU6V1qdQAYz6sqT3mz-GEi85CxW7E5ptiO5MecpOsHg"},"status":"hoàn thành","success":true},"err":false,"msg":"THÀNH CÔNG","code":200}
Truy vấn Trạng thái Thu thập Cấp Trang
Trả về tiến độ thu thập tổng thể: tổng số trang được phát hiện, hoàn thành, đang chờ và thất bại. Sử dụng điểm cuối này để theo dõi các công việc thu thập dài hạn và xác định khi nào tất cả các trang có sẵn để lấy.
Trả về các kết quả theo trang cho một thu thập cấp trang đã hoàn thành hoặc đang trong quá trình thực hiện, được phân trang bằng cách sử dụng con trỏ. Sử dụng điểm cuối này để lấy nội dung đã được xử lý từng trang một, theo dõi các URL nào thành công hoặc thất bại, và cho kết quả vào các quy trình tiếp theo khi chúng hoàn thành thay vì chờ cho toàn bộ thu thập hoàn tất.
Sử dụng nextCursor để phân trang qua các kết quả khi thu thập đã xử lý nhiều trang hơn một phản hồi đơn trả về. Điều này đặc biệt hữu ích cho các thu thập trang web lớn mà việc lấy tất cả kết quả cùng một lúc sẽ tạo ra một phản hồi quá lớn.
4. Đọc Kết quả Tệp Lớn
Đối với các đầu ra lớn — tài liệu Markdown, HTML toàn trang, ảnh chụp màn hình, PDF và dữ liệu trang thô — API trả về một mã tham chiếu thay vì nội dung trong dòng. Mã tham chiếu được bao gồm trong kết quả nhiệm vụ dưới các trường sau:
markdownRef — đầu ra Markdown đã được làm sạch
htmlRef — đầu ra HTML đã được làm sạch
rawDataRef — dữ liệu trang thô như đã lấy từ máy chủ mục tiêu
screenshotRef — hình ảnh chụp màn hình toàn trang
pdfRef — tệp PDF đã xuất
Lấy nội dung đầy đủ bằng cách truyền mã tham chiếu tới điểm cuối lưu trữ:
GET /api/v1/crawl/storage/read?st={ref}
Sử dụng điểm cuối này để tải xuống ảnh chụp màn hình cho QA hình ảnh, lấy PDF cho quy trình lưu trữ, hoặc đọc các tài liệu Markdown lớn vượt quá kích thước giới hạn của phản hồi trong dòng. Mã tham chiếu được gắn với nhiệm vụ đã tạo ra chúng — luôn sử dụng mã trả về từ kết quả nhiệm vụ, không phải giá trị tự xây dựng.
Ví dụ SDK
SDK chính thức có sẵn cho Node.js, Python và Go. Mỗi SDK cung cấp các mô hình yêu cầu và phản hồi có kiểu và có thể được tích hợp trực tiếp vào các dịch vụ, quy trình dữ liệu, công cụ đại lý và quy trình thu hấp RAG hiện có.
import os
from nstdata_ai_crawl import NstDataClient, ScrapeRequestDto, Format
TOKEN = os.getenv("NSTDATA_API_TOKEN","YOUR_API_TOKEN")with NstDataClient(TOKEN)as client: res = client.submit_scrape_task_sync(ScrapeRequestDto( url="https://example.com/", formats=[Format.MARKDOWN], timeout=60000, onlyMainContent=True,))print(res.data.get_markdown())
C crawling cấp site
from nstdata_ai_crawl import NstDataClient, CrawlRequestDto, Format
with NstDataClient("YOUR_API_TOKEN")as client: submit = client.submit_crawl_task(CrawlRequestDto( url="https://example.com/", formats=[Format.MARKDOWN, Format.HTML], maxDepth=3, maxPages=50, ignoreQuery=True, onlyMainContent=True,))print(submit.id) status = client.get_crawl_status(submit.id)print(status)
Nstdata Crawl được thiết kế cho các đội ngũ cần dữ liệu web có cấu trúc, đáng tin cậy mà không cần duy trì hạ tầng thu thập dữ liệu phức tạp. Dù bạn đang xây dựng ứng dụng AI, theo dõi đối thủ, hay thu thập dữ liệu quy mô lớn, Crawl cung cấp nội dung web được render bởi trình duyệt, sẵn sàng cho LLM thông qua một API duy nhất.
Tăng cường Kiến thức Đại lý AI (RAG) — Tự động chuyển đổi tài liệu doanh nghiệp, hướng dẫn kỹ thuật, và trang sản phẩm thành Markdown sạch và đưa nội dung vào cơ sở dữ liệu vector trong thời gian thực. Nstdata Crawl xử lý việc render JavaScript và làm sạch nội dung để các pipeline RAG nhận đầu vào có cấu trúc, không nhiễu — không phải HTML thô đầy các script và markup điều hướng.
Giám sát Giá cả và Tồn kho Động — Thu thập các trang sản phẩm của đối thủ theo lịch trình và trích xuất dữ liệu giá cả, thông số SKU, tình trạng tồn kho, và dữ liệu khuyến mãi dưới dạng JSON có cấu trúc. Mỗi lần chạy phản ánh trang thực mà một người dùng thực sự sẽ thấy — bao gồm giá cả được render bằng JavaScript — vì vậy chiến lược định giá của bạn được dựa trên dữ liệu thị trường trực tiếp, không phải các bức ảnh lưu cache.
Giám sát Tâm lý Thương hiệu và Danh tiếng — Thu thập nội dung từ các nền tảng xã hội, diễn đàn, và trang đánh giá quy mô lớn và đưa vào các pipeline phân tích tâm lý. Crawl trả về đầu ra văn bản sạch có thể gắn trực tiếp vào bước phân loại LLM — mà không cần xử lý định dạng thủ công hoặc viết parser tùy chỉnh cho từng nguồn.
Tạo Dẫn B2B — Tự động trích xuất mô tả công ty, các vị trí còn mở, thông tin liên hệ, và phạm vi kinh doanh từ các trang web công ty mục tiêu. Xây dựng danh sách khách hàng có cấu trúc từ dữ liệu web công khai mà không cần duy trì một bộ thu thập dữ liệu cho mỗi miền nguồn.
Theo dõi thông tin đối thủ — Giám sát các trang web của đối thủ để cập nhật tính năng, thông cáo báo chí, thay đổi giá cả và thiết kế lại. Đầu ra có cấu trúc từ mỗi lần thu thập thông tin giúp dễ dàng so sánh nội dung qua các khoảng thời gian và làm nổi bật những thay đổi có ý nghĩa cho các đội sản phẩm và chiến lược.
Phân tích cấu trúc trang SEO — Thu thập các trang của đối thủ hoặc trang của riêng mình quy mô lớn để trích xuất thẻ tiêu đề, mô tả meta, cấu trúc tiêu đề, nội dung chính và các mẫu liên kết nội bộ. Đưa đầu ra trực tiếp vào một LLM để tự động kiểm tra SEO và đề xuất tối ưu hóa.
Thu thập thông tin học thuật và ngành — Trích xuất các điểm dữ liệu chính, siêu dữ liệu tác giả và nội dung có cấu trúc từ các kho lưu trữ tài liệu nghiên cứu, ấn phẩm của chính phủ và các trang báo cáo ngành. Tăng tốc quy trình viết báo cáo và xem xét tài liệu mà không cần tải xuống và phân tích thủ công từng nguồn.
Khám phá sản phẩm thương mại điện tử và phân tích xu hướng — Thu thập danh sách sản phẩm của các thị trường lớn để trích xuất xếp hạng, chỉ số bán hàng, từ khóa đánh giá và xu hướng giá cả. Cung cấp dữ liệu có cấu trúc cho các đội ngũ tiếp thị và vận hành để xác định các sản phẩm có tiềm năng cao trước khi chúng đạt đến ngưỡng bão hòa.
Giám sát tuân thủ web và thay đổi — So sánh định kỳ cấu trúc HTML và nội dung văn bản của các trang hiển thị công khai với những khoảnh khắc trước đó. Nổi bật những thay đổi trong điều khoản dịch vụ, chính sách quyền riêng tư, thông báo tuân thủ hoặc tiết lộ quy định trước khi chúng ảnh hưởng đến hoạt động kinh doanh.
Xây dựng chỉ mục tìm kiếm theo ngành — Xây dựng các chỉ mục truy xuất riêng cho các ngành cụ thể — chăm sóc sức khỏe, pháp lý, tài chính — bằng cách thu thập các trang web theo ngành thông qua API và đồng bộ hóa các bản cập nhật theo thời gian thực. Giữ cho các công cụ tìm kiếm theo miền cụ thể luôn cập nhật mà không cần duy trì cơ sở hạ tầng thu thập riêng cho mỗi nguồn.
Cách đưa dữ liệu web theo thời gian thực vào các tác nhân AI và hệ thống RAG bằng cách sử dụng Nstdata Crawl
Việc đưa nội dung web vào một quy trình AI là một bài toán hai phần: lấy trang một cách đáng tin cậy, và cung cấp nó trong định dạng mà hệ thống hạ nguồn có thể thực sự sử dụng. Hầu hết các nhóm giải quyết phần đầu tiên với một trình thu thập dữ liệu và phát hiện phần thứ hai sau — khi HTML thô đầy đánh dấu điều hướng, banner cookie, và thẻ script xuất hiện trong một bước phân đoạn không được thiết kế để làm sạch nó.
Nstdata Crawl xử lý cả hai vấn đề. Hai mô hình tích hợp sau đây cho thấy cách nó phù hợp với các quy trình dữ liệu AI phổ biến nhất: như một công cụ đọc web theo thời gian thực cho các tác nhân AI, và như lớp thu thập và làm sạch ở phía trước của một quy trình RAG.
Tích hợp Nstdata Crawl với các tác nhân AI
Các tác nhân AI thường cần truy xuất thông tin hiện tại từ web — trang web công ty, trang tin tức, tài liệu sản phẩm, blog, diễn đàn và nguồn dữ liệu công khai. Nstdata Crawl hoạt động như lớp đọc web cho Tác nhân: Tác nhân cung cấp một URL, Crawl lấy trang và trả về Markdown, HTML, hoặc đầu ra có cấu trúc sạch, và Tác nhân tiếp tục với việc tóm tắt, trả lời câu hỏi, so sánh, hoặc trích xuất trường dữ liệu.
Cách nó hoạt động:
Tác nhân nhận một câu hỏi từ người dùng hoặc mục tiêu nhiệm vụ.
Tác nhân xác định các URL nào cần được truy cập.
Tác nhân gọi Nstdata Crawl để lấy nội dung trang.
Crawl trả về Markdown đã được làm sạch.
Tác nhân sử dụng Markdown cho việc tóm tắt, Q&A, trích xuất có cấu trúc, hoặc tạo báo cáo.
Mô hình này rất phù hợp cho các ứng dụng AI cần truy cập web theo thời gian thực. Ba loại Tác nhân phổ biến được hưởng lợi trực tiếp:
Tác nhân Nghiên cứu — Tự động đọc các trang web, kho lưu trữ tài liệu học thuật, nguồn tin tức và ấn phẩm ngành để tạo ra tóm tắt nghiên cứu và báo cáo so sánh. Crawl xử lý các trang được render bằng JavaScript và làm sạch nội dung nên Tác nhân nhận được đầu vào có cấu trúc, không phải HTML thô.
Tác nhân Thông tin Bán hàng — Thu thập các trang web công ty, trang nghề nghiệp, thông cáo báo chí, và trang sản phẩm để trích xuất hồ sơ khách hàng, tín hiệu kinh doanh, và cơ hội bán hàng. Đầu ra Markdown có cấu trúc giúp việc trích xuất trường trở nên dễ dàng mà không cần các bộ phân tích tùy chỉnh cho mỗi miền.
Tác nhân Giám sát Thị trường — Liên tục theo dõi các trang web đối thủ, trang giá, trang thông báo, và cập nhật thị trường. Mỗi lần thu thập thông tin trả về đầu ra có cấu trúc nhất quán, làm cho việc phát hiện những thay đổi có ý nghĩa qua các lần thu thập trở nên hợp lý và tạo ra cảnh báo xu hướng tự động.
Tích hợp Nstdata Crawl với Hệ thống RAG
Trong một quy trình RAG, nội dung web thường đi qua các bước thu thập, làm sạch, phân đoạn, nhúng và lập chỉ mục trước khi nó có sẵn để truy xuất. Nstdata Crawl xử lý hai bước đầu tiên — thu thập web và làm sạch nội dung — chuyển đổi các trang web phức tạp thành Markdown sạch và giảm thiểu gánh nặng xử lý văn bản ở hạ nguồn.
Chuỗi quy trình RAG điển hình với Nstdata Crawl:
Sử dụng Nstdata Crawl để truy xuất các trang mục tiêu hoặc thu thập toàn bộ trang web.
Chuẩn hóa và làm sạch Markdown đã trả về.
Phân đoạn nội dung thành các khối theo tiêu đề, đoạn văn, hoặc số lượng token.
Tạo nhúng bằng cách sử dụng mô hình nhúng.
Viết văn bản, vector và metadata vào cơ sở dữ liệu vector.
Vào thời điểm truy vấn, lấy các phần liên quan từ cơ sở dữ liệu vector và chuyển chúng cho LLM để tạo ra câu trả lời.
Các thành phần tương thích:
Loại
Ví dụ
Khung RAG
LangChain, LlamaIndex
Mô hình nhúng
OpenAI Embeddings, Cohere, các mô hình mã nguồn mở
Cơ sở dữ liệu vector
Pinecone, Weaviate, Qdrant, pgvector
Mô hình tích hợp này phù hợp cho các cơ sở kiến thức doanh nghiệp, hệ thống Q&A tài liệu, trợ lý hướng dẫn sản phẩm, thư viện nghiên cứu ngành và kho thông tin cạnh tranh — bất kỳ ứng dụng nào mà nguồn kiến thức là web công cộng và lớp truy xuất cần đầu vào sạch, có cấu trúc.
So sánh Nstdata Crawl
1. Nstdata Crawl so với các trình thu thập truyền thống
Một trình thu thập nội bộ truyền thống cho một nhóm hoàn toàn quyền kiểm soát, nhưng nhóm cũng phải vận hành mọi lớp: máy khách HTTP, trình duyệt, xoay proxy, tính nhất quán dấu vân tay, quy tắc trích xuất, hàng đợi công việc, chính sách thử lại, lưu trữ, ghi log, giám sát và ứng phó sự cố.
Nstdata Crawl đóng gói những khả năng đó qua một API tiêu chuẩn. Nó phù hợp hơn khi một nhóm muốn dữ liệu web nhất quán mà không biến việc bảo trì trình thu thập thành một dự án hạ tầng dài hạn. Một trình thu thập nội bộ vẫn có thể hợp lý khi quy trình làm việc yêu cầu hành vi cấp thấp chuyên biệt, phân tích tùy chỉnh cao, hoặc quyền kiểm soát hoàn toàn đối với môi trường thực thi.
Khu vực
Trình thu thập truyền thống
Nstdata Crawl
Kết xuất JavaScript
Xây dựng và vận hành công nhân trình duyệt
Quản lý qua các yêu cầu Crawl
Quản lý proxy
Tìm nguồn, xoay vòng và giám sát proxy
Hạ tầng proxy Nstdata tích hợp
Dấu vân tay trình duyệt
Triển khai và duy trì hồ sơ
Quản lý lớp dấu vân tay-trình duyệt
Làm sạch nội dung
Xây dựng quy tắc trích xuất và chuyển đổi
Đầu ra Markdown, HTML và có cấu trúc
Thử lại và hàng đợi
Xây dựng hạ tầng tác vụ
Thử lại tự động và lên lịch quản lý
Kết quả lớn
Xây dựng lưu trữ tệp
Lấy dữ liệu dựa trên tham chiếu
Bảo trì
Kỹ thuật và vận hành liên tục
Tập trung qua một API
2. Nstdata Crawl so với Firecrawl, Jina Reader và Tavily
Những sản phẩm này giải quyết các phần khác nhau của vấn đề dữ liệu web. Firecrawl và Jina Reader thường được xem xét để chuyển đổi các trang web thành nội dung có thể đọc được bởi LLM, trong khi Tavily thường được sử dụng cho tìm kiếm và khám phá web hướng đến AI. Chúng có thể hiệu quả khi yêu cầu chính là đọc trang nhẹ nhàng, chuyển đổi Markdown, hoặc kết quả tìm kiếm.
Nstdata Crawl được định vị như một lớp hạ tầng thu thập rộng hơn cho các khối lượng công việc sản xuất mà việc truy cập trang đáng tin cậy quan trọng không kém gì việc chuyển đổi nội dung. Sự phân biệt của nó tập trung vào sự kết hợp của thực thi dấu vân tay-trình duyệt, kết xuất JavaScript, hành động trình duyệt, tài nguyên proxy Nstdata, nhắm mục tiêu địa lý, quản lý tác vụ không đồng bộ, thu thập ở cấp độ trang, và nhiều định dạng tài liệu.
Lựa chọn đúng phụ thuộc vào khối lượng công việc:
Chọn trình đọc nhẹ khi các trang dễ truy cập và yêu cầu chính là chuyển đổi URL sang Markdown thỉnh thoảng.
Chọn dịch vụ tập trung vào tìm kiếm khi việc tìm các trang liên quan quan trọng hơn việc kiểm soát cách mỗi trang được kết xuất và thu thập.
Chọn Nstdata Crawl khi khối lượng công việc bao gồm các trang web động phức tạp, truy cập khu vực, thu thập thương mại lặp lại, đồng thời cao, hoặc yêu cầu hoạt động liên quan đến thử lại, tiến trình, và lưu trữ kết quả.
Chỉ số đánh giá hữu ích nhất là chi phí mỗi trang sử dụng được, chứ không phải chỉ là chi phí mỗi yêu cầu. Hãy kiểm tra các URL được phép đại diện và so sánh tính hoàn chỉnh nội dung, độ chính xác đã kết xuất, chất lượng Markdown, độ trễ, tỷ lệ thành công, tính nhất quán địa lý, khả năng chẩn đoán, và nỗ lực bảo trì liên tục.
Sử dụng Hợp pháp và Có trách nhiệm
Nstdata Crawl được thiết kế để thu thập và xử lý hợp pháp dữ liệu web công cộng. Truy cập kỹ thuật không tự động thiết lập quyền hợp pháp để thu thập, lưu trữ hoặc sử dụng nội dung.
Trước khi bắt đầu một lần thu thập, xác nhận rằng mục tiêu, mục đích thu thập, và phương pháp xử lý tuân thủ các luật hiện hành, điều khoản của trang web, yêu cầu về quyền riêng tư, nghĩa vụ bản quyền, và chính sách nội bộ của tổ chức bạn. Đừng sử dụng dịch vụ để vượt qua xác thực, né tránh tường thu phí hoặc quyền, thu thập dữ liệu không công khai, hoặc thu thập thông tin cá nhân có quy định mà không có cơ sở pháp lý hợp lệ.
Cookies và tiêu đề tùy chỉnh có thể chứa thông tin xác thực hoặc dữ liệu phiên. Lưu trữ chúng một cách an toàn, hạn chế quyền truy cập, tránh ghi chúng vào log, và chỉ giữ lại nếu cần thiết. Sử dụng tỷ lệ yêu cầu hợp lý, đặt ranh giới thu thập rõ ràng, cache nội dung không thay đổi, và tránh đặt tải không cần thiết lên các trang web mục tiêu.
Khắc phục sự cố Yêu cầu
Do not use the HTTP status alone to determine whether a task succeeded. An HTTP 200 means the API request was processed, but the crawl task itself may still return success: false. Always inspect status, success, errorCode, and errorMessage in the response body.
Status or error
Meaning
Recommended action
400 yêu cầu không hợp lệ
Thiếu, định dạng sai, hoặc tham số không hợp lệ
Xác thực cơ thể JSON, các trường bắt buộc, và kiểu trường
402 số dư không đủ
Tài khoản không có đủ số dư
Thêm tín dụng hoặc sử dụng tài khoản hoặc nhóm đã được tài trợ
403 URL không hợp lệ
URL không hợp lệ, quá dài, bị cấm, hoặc không thể phân giải
Sử dụng URL HTTP/HTTPS công khai hợp lệ và kiểm tra DNS
404 không tìm thấy tác vụ
ID tác vụ hoặc crawl không chính xác hoặc không thể truy cập
Kiểm tra ID và đảm bảo thông tin xác thực khớp với chủ sở hữu tác vụ
429 giới hạn tần suất đã vượt quá
Tần suất yêu cầu vượt quá giới hạn tài khoản
Giảm tần suất yêu cầu và thử lại với backoff theo cấp số nhân
429 giới hạn đồng thời đã đạt tới
Quá nhiều tác vụ đang chạy
Chờ các công việc đang hoạt động hoàn thành trước khi gửi thêm
503 dịch vụ không khả dụng
Một tác vụ, lưu trữ, thanh toán, hoặc dịch vụ hạ nguồn tạm thời không khả dụng
Thử lại sau với backoff theo cấp số nhân có giới hạn
504 đồng bộ hết thời gian
Yêu cầu đồng bộ đã vượt quá cửa sổ chờ của nó
Sử dụng gửi không đồng bộ và kiểm tra kết quả
timeout
Thực thi trang đã vượt quá thời gian chờ được cấu hình
Đơn giản hóa các hành động của trình duyệt, điều chỉnh thời gian chờ, hoặc thử lại sau
parse_error
Trang không thể được phân tích
Thử đầu ra HTML hoặc thô, điều chỉnh bộ chọn, và xác minh khả năng truy cập
access_denied
Đối tượng từ chối hoặc bị chặn bởi chính sách tác vụ
Xác nhận rằng đối tượng được phép và sử dụng nguồn ủy quyền khác
For production troubleshooting, record the request ID, task ID, URL, submission time, output formats, timeout, rendering settings, and non-secret request parameters. Never log API keys, authentication cookies, or sensitive headers.
When receiving 429, honor Retry-After when provided and use exponential backoff with jitter — for example, progressively waiting about 1, 2, 4, and 8 seconds. Do not immediately send the same request at high frequency.
FAQ
Q1. What is Nstdata Crawl?
Nstdata Crawl is an AI-powered web crawling API that turns public web pages into clean, structured outputs such as Markdown, HTML, raw data, screenshots, PDFs, and links. It manages rendering, proxies, fingerprints, extraction, retries, task scheduling, and result retrieval.
Q2. How is Nstdata Crawl different from a normal HTTP request?
A normal HTTP client generally retrieves the server's initial response. Nstdata Crawl can execute JavaScript, wait for dynamic content, perform browser actions, route traffic through proxies, clean page content, convert it to Markdown, and manage asynchronous task state.
Q3. Does Nstdata Crawl support JavaScript-rendered pages?
Yes. It can load a page in a browser environment, wait for rendering or a specified selector, perform configured browser actions, and extract the final page state.
Q4. Can Nstdata Crawl process an entire website?
Yes. Site-level crawling starts from an entry URL and discovers internal pages. Use maxDepth, maxPages, include rules, exclude rules, and query handling to keep the crawl within the intended scope.
Q5. Is Nstdata Crawl suitable for RAG?
Yes. Its Markdown output is designed for AI workflows and can be cleaned, chunked, embedded, and written to a vector database as part of a RAG ingestion pipeline.
Q6. Does Nstdata Crawl support screenshots and PDFs?
Yes. Both formats are included in the crawling service. Large files may be returned through reference tokens and retrieved through the storage endpoint.
Q7. Does Nstdata Crawl support cookies and custom headers?
Yes. Requests can include cookies for authorized session-based access and custom headers for language, User-Agent, business identifiers, or other request requirements. Treat these values as credentials when they contain sensitive information.
Q8. Does Nstdata Crawl offer a bulk URL API or webhooks?
Nstdata Crawl does not currently provide a dedicated bulk-URL endpoint or a public webhook. Applications can submit multiple asynchronous page tasks with controlled concurrency and retrieve results by polling task-status endpoints. Site-level Crawl can be used for linked pages within a website.
Q9. How much does Nstdata Crawl cost?
Pay-as-you-go pricing starts at $1.20 per 1,000 requests. New users receive $1 in trial credit after applying for a trial. JavaScript rendering, Markdown extraction, PDFs, and screenshots are included, while proxy usage is billed separately.
Q10. How can I improve crawl success rates?
Bật chế độ kết xuất JavaScript cho các trang động, chờ một bộ chọn nội dung đáng tin cậy, sử dụng cookie hoặc tiêu đề phù hợp cho các phiên đã được ủy quyền, chọn một khu vực proxy phù hợp, giữ cho việc thu thập dữ liệu trang web được giới hạn, giảm tần suất yêu cầu, và sử dụng chế độ không đồng bộ cho các công việc chậm hoặc lớn.
Kết luận: Xây dựng Lớp Dữ liệu Web Một Lần
Nếu bạn đang xây dựng một tác nhân AI, một pipeline RAG, một công cụ thông tin thị trường, hoặc bất kỳ hệ thống nào phụ thuộc vào việc đọc web trực tiếp, lớp scraper không nên là điều bạn phải duy trì. Nstdata Crawl biến lớp đó thành một cuộc gọi API duy nhất, đáng tin cậy — bao gồm kết xuất, xử lý chống bot, thử lại, và dọn dẹp.
Bắt đầu với phần Khởi động Nhanh ở trên và kiểm tra nó với một URL thực tế từ quy trình làm việc của bạn. Nếu bạn cần nhiều khả năng đồng thời hơn, các chiến lược thu thập dữ liệu nâng cao hơn, hoặc hỗ trợ cấp doanh nghiệp, hãy liên hệ với đội ngũ — chúng tôi rất vui được thảo luận về thiết lập cụ thể của bạn.