TL;DR
- LLM-CrawlBench là một bộ chuẩn để đánh giá xem liệu các tác nhân đa phương thức hoặc sử dụng công cụ có thể trích xuất thông tin mục tiêu từ các trang web thực tế đối kháng hay không. Đây không phải là một bảng xếp hạng chung cho các API thu thập dữ liệu thương mại.
- Bảng chuẩn quan trọng vì thông tin có thể thấy được về mặt thị giác có thể khó khăn cho các tác nhân trong việc phục hồi khi các trang sử dụng lớp phủ, yếu tố gây hiểu nhầm hoặc nội dung dựa trên hình ảnh.
- Điểm số chuẩn không nên được coi là tỷ lệ thành công trong sản xuất. Đánh giá trong sản xuất cũng cần phạm vi pháp lý, độ đầy đủ của nội dung, độ trễ, chi phí, hành vi thử lại và nguồn gốc.
- Các đội nên tái sản xuất các danh mục nhiệm vụ giống như khối lượng công việc của họ và xây dựng một tập dữ liệu giữ lại riêng. Một điểm số tổng hợp có thể che giấu những điểm yếu nghiêm trọng trong một loại trang quan trọng.
- Nstdata Crawl có thể hỗ trợ một lớp thu thập dữ liệu sản xuất, trong khi đánh giá theo kiểu CrawlBench thuộc về lớp chấp nhận và hồi quy.
CrawlBench LLM extraction là gì?
LLM-CrawlBench đánh giá mức độ hiệu quả mà các tác nhân dựa trên LLM trích xuất thông tin từ các trang web trình bày điều kiện thị giác và tương tác đối kháng. Bộ chuẩn này có liên quan đến các nhóm xây dựng tác nhân web, hệ thống trích xuất đa phương thức và hệ thống dữ liệu AI vì nó kiểm tra nhiều hơn việc phân tích HTML thông thường. Nstdata Crawl hoạt động ở một lớp khác: nó thu thập và biến đổi nội dung web được ủy quyền cho các hệ thống tiếp theo, trong khi một bộ chuẩn đo lường mức độ hoàn thành của một tác nhân hoặc quy trình một nhiệm vụ đã định nghĩa.
Cụm từ tìm kiếm “crawlbench llm extraction” có thể bị nhầm lẫn với các bộ chuẩn web-crawler chung. Tài liệu có sẵn mô tả LLM-CrawlBench như một bộ chuẩn tập trung vào việc trích xuất hình ảnh đối kháng từ các trang web thực tế. Phạm vi đó nên được nêu rõ ràng vì những kết luận về việc trích xuất hình ảnh không tự động chuyển sang độ hoàn chỉnh của văn bản, phát hiện trang, chất lượng RAG, hoặc độ tin cậy của dịch vụ thương mại.
Tại sao việc trích xuất trang web đối kháng lại khó khăn?
Các trang web đối kháng có thể đặt thông tin hữu ích sau sự lộn xộn thị giác, các lớp modal, các điều khiển gây hiểu nhầm, hoặc các yếu tố hình ảnh mà không được đại diện tốt trong DOM. Một tác nhân chỉ nhận văn bản có thể không bao giờ nhìn thấy bằng chứng mục tiêu. Một tác nhân có khả năng thị giác có thể thấy nó nhưng vẫn chọn tương tác sai hoặc đọc nhầm giá trị. Một tác nhân có khả năng trình duyệt có thể hoàn tất tương tác nhưng mất nguồn gốc hoặc không thể tái sản xuất kết quả.
Những khó khăn này giải thích tại sao đánh giá nên tách biệt cảm nhận, điều hướng, trích xuất và xác minh. Một chỉ số “nhiệm vụ đã hoàn thành” đơn lẻ không thể cho thấy liệu một tác nhân có thành công hay không vì nó đã hiểu trang, đoán đúng hoặc khai thác một hiện tượng chuẩn. Bài viết của Nstdata về nhận diện trình duyệt cung cấp thông tin hữu ích về lý do tại sao hành vi có thể nhìn thấy của trình duyệt và các yêu cầu mạng có thể khác nhau, mặc dù việc nhận diện không phải là chủ đề trung tâm của bộ chuẩn.
Chuyển Đổi Trang Web Thành Dữ Liệu Có Thể Sử DụngSử dụng Nstdata Crawl để chuyển đổi một URL thành các đầu ra sạch cho AI, RAG, và các quy trình làm việc dữ liệu. Thiết lập Crawl |
Markdown
JSON
{
"title": "...", "url": "..." } Ảnh chụp màn hình
|
Đánh giá CrawlBench hữu ích sẽ đo lường điều gì?
Một đánh giá hữu ích sẽ đo lường sự thành công của nhiệm vụ cùng với các bằng chứng và nguồn lực cần thiết để đạt được nó. Định nghĩa nhiệm vụ gốc của chuẩn mực nên được giữ nguyên để tái tạo, trong khi các nhóm sản xuất bổ sung các phép đo vận hành ảnh hưởng đến việc triển khai.
Hoàn thành nhiệm vụ
Hoàn thành nhiệm vụ đặt câu hỏi liệu hệ thống có trả về thông tin mục tiêu chính xác không. Kết quả chính xác là phù hợp đối với các định danh hoặc giá trị ngắn, trong khi việc khớp chuẩn hóa có thể cần thiết cho các biến thể về khoảng trắng, dấu câu hoặc định dạng. Việc điểm số ngữ nghĩa nên được sử dụng cẩn thận vì một sự khớp gần lưu loát vẫn có thể sai.
Ghi nhận bằng chứng
Ghi nhận bằng chứng đặt câu hỏi liệu hệ thống có thể chỉ ra khu vực trang, hình ảnh hoặc tài liệu nguồn hỗ trợ cho câu trả lời hay không. Điều này có ý nghĩa khi một người đánh giá phải phân biệt giữa một trích dẫn chính xác và một phỏng đoán hợp lý. Lưu trữ URL, thời gian truy xuất, ảnh chụp màn hình hoặc tài liệu trang và dấu vết hành động khi chuẩn mực cho phép.
Tái tạo
Tái tạo đặt câu hỏi liệu kết quả có tồn tại qua các lần chạy lặp lại và sự thay đổi môi trường không. Ghi lại phiên bản trình duyệt, viewport, địa phương, điều kiện mạng, phiên bản mô hình, phiên bản lời nhắc và cấu hình công cụ. Nếu các kết quả thay đổi về mặt vật chất, hãy báo cáo phân phối thay vì một lần chạy thuận lợi.
Đối với khả năng lặp lại ở cấp trình duyệt, tiêu chuẩn W3C WebDriver cung cấp một tham khảo hữu ích cho ngữ nghĩa tự động hóa. tài liệu chính thức của Playwright là một nguồn thực tế để gắn kết hành vi tự động hóa trình duyệt trong một bộ thử nghiệm có thể tái tạo.
Chi phí vận hành
Chi phí vận hành bao gồm token mô hình, thời gian trình duyệt, cuộc gọi mạng, thử lại và đánh giá của con người. Một hệ thống chậm hơn có thể vẫn được ưa chuộng nếu nó tạo ra câu trả lời có thể xác thực và ít kết quả dương tính giả hơn. So sánh chi phí cho mỗi trích xuất được chấp nhận thay vì các nỗ lực nhiệm vụ thô.
Các nhóm nên diễn giải kết quả chuẩn mực như thế nào?
Các nhóm nên diễn giải một chuẩn mực như bằng chứng về các nhiệm vụ, mô hình, lời nhắc và môi trường đã được thử nghiệm. bài báo LLM-CrawlBench là nguồn chính cho cấu trúc của nó và các kết quả được báo cáo. Mọi tuyên bố về hiệu suất của mô hình nên được gắn liền với tập dữ liệu và quy trình đánh giá chính xác của bài báo thay vì tổng quát thành “độ chính xác của việc thu thập thông tin trên web.” Ba câu hỏi giúp bảo vệ chống lại việc tổng quát hóa quá mức. Đầu tiên, các trang chuẩn có giống với các nguồn sản xuất không? Thứ hai, chuẩn có yêu cầu các đầu ra và bằng chứng giống nhau không? Thứ ba, các ràng buộc về chi phí và độ trễ có thể so sánh được không? Nếu bất kỳ câu trả lời nào là không, hãy sử dụng chuẩn để tạo ra các giả thuyết thay vì kết luận mua hàng.
Làm thế nào bạn xây dựng một chuẩn sản xuất từ ý tưởng CrawlBench?
Xây dựng một chuẩn sản xuất với một tập hợp hợp pháp, đại diện và một quy trình đánh giá đã được đóng băng. Bao gồm các trang thông thường, các trang được kết xuất JavaScript, các trang có nhiều hình ảnh, bảng, tài liệu dài, các mẫu lặp lại và các thất bại đã biết. Tách biệt các ví dụ phát triển khỏi một tập hợp giữ lại để việc tinh chỉnh prompt không chỉ đơn giản là ghi nhớ đánh giá.
Đối với mỗi trang, xác định bằng chứng mong đợi, đầu ra được chấp nhận, suy luận bị cấm và hành vi thất bại cuối cùng. Lưu trữ các tài liệu nguồn hoặc băm để phân biệt một lỗi mô hình với một trang đã thay đổi. Hướng dẫn của Nstdata về phát hiện bot chống lại là thích hợp cho việc chẩn đoán hành vi truy cập, nhưng việc đánh giá không bao giờ nên khuyến khích việc vượt qua các quyền truy cập.
Hướng dẫn của Nstdata về kết xuất JavaScript quy mô lớn thêm một tham chiếu nội bộ thứ ba để thiết kế một tập hợp phân biệt hoàn thiện được kết xuất với độ chính xác trong việc trích xuất.
Nstdata Crawl phù hợp ở đâu trong chuỗi đánh giá?
Nstdata Crawl phù hợp trong lớp thu thập và tài liệu của một đánh giá sản xuất. Nó có thể thu thập các trang được cấp phép hoặc các trang có giới hạn và trả về các đại diện được sử dụng bởi các tác nhân và xác thực phía dưới. Lớp chuẩn nên đo lường xem toàn bộ quy trình có tạo ra các kết quả chính xác và có thể quy cho không.
- Kiểm tra thu thập: Trang mong đợi có tải và trả về nội dung yêu cầu không?
- Kiểm tra chuyển đổi: Việc làm sạch có giữ lại tiêu đề, bảng, liên kết và bằng chứng hình ảnh liên quan không?
- Kiểm tra trích xuất: Mô hình có trả về giá trị được yêu cầu mà không có suy luận không được hỗ trợ không?
- Kiểm tra chấp nhận: Các quy tắc xác định và đánh giá có phê duyệt hồ sơ không?
Sử dụng tài liệu Crawl hiện tại để xác minh các hình thức và đầu ra thu thập có sẵn. Sử dụng giá Nstdata Crawl để xác nhận mô hình thanh toán hiện tại trước khi chạy một chuẩn lớn hơn.
Giới hạn của việc kiểm tra kiểu CrawlBench là gì?
Kiểm tra kiểu CrawlBench không thể thiết lập quyền hợp pháp, thời gian hoạt động sản xuất, chất lượng hỗ trợ của nhà cung cấp hoặc tổng chi phí hệ thống. Nó cũng có thể trở nên lỗi thời khi các trang web, trình duyệt và mô hình thay đổi. Một chuẩn công khai có thể đại diện quá mức cho các tác vụ rõ nét về mặt hình ảnh trong khi không đại diện đầy đủ cho các thất bại tầm thường nhưng tốn kém như chuẩn hóa, phân trang, hồ sơ trùng lặp và nội dung lỗi thời.
Các nhóm sản xuất do đó nên duy trì một bộ hồi quy riêng tư. Bộ này nên bao gồm các trường hợp không có câu trả lời và các thất bại dự kiến, không chỉ các trang mà một giá trị mục tiêu tồn tại. Điều này giảm thiểu khả năng một tác nhân được thưởng cho việc luôn trả về một câu trả lời.
Kết luận
LLM-CrawlBench hữu ích cho việc hiểu quá trình trích xuất trang web đối kháng, nhưng kết quả của nó nên luôn hạn chế trong các tác vụ được đánh giá. Nhân bản các danh mục liên quan, thêm các bằng chứng và chỉ số chi phí, và duy trì một tập hợp giữ lại riêng tư gắn liền với khối lượng công việc sản xuất. Nếu chất lượng thu thập và tài liệu là một phần của thí nghiệm, hãy sử dụng Nstdata Crawl như một lớp thu thập ứng viên và đánh giá nó với cùng các tiêu chí chấp nhận áp dụng cho mọi lựa chọn thay thế.
Trải nghiệm Nstdata — Bắt đầu dùng thử miễn phí của bạn hôm nay
Câu hỏi thường gặp
Q: LLM-CrawlBench có phải là một chuẩn cho các API thu thập dữ liệu thương mại không?
Không. LLM-CrawlBench tập trung vào các nhiệm vụ trích xuất của tác nhân LLM từ các trang web đối kháng, vì vậy việc đánh giá thu thập dữ liệu thương mại yêu cầu các thử nghiệm hoạt động bổ sung.
Q: Trích xuất hình ảnh đối kháng là gì?
Trích xuất hình ảnh đối kháng kiểm tra xem một tác nhân có thể xác định và khôi phục thông tin mục tiêu khi việc trình bày hình ảnh hoặc tương tác trang làm cho nhiệm vụ trở nên khó khăn một cách cố ý hay không.
Q: Một điểm số CrawlBench cao có thể dự đoán chất lượng RAG không?
Không. Chất lượng RAG cũng phụ thuộc vào việc phát hiện, tính đầy đủ nội dung, phân đoạn, nhúng, truy xuất, độ mới và căn cứ câu trả lời.
Q: Một chuẩn tác nhân web tư nhân nên bao gồm những gì?
Nó nên bao gồm các trang hợp pháp, đại diện, bằng chứng mong đợi, các trường hợp không có câu trả lời, các thất bại đã biết, các quy tắc chấm điểm đã được đóng băng và một tập hợp giữ lại.
Q: Tại sao lại ghi lại ảnh chụp màn hình hoặc tài liệu nguồn? Tài liệu nguồn cho phép người đánh giá xác minh xem tác nhân có trích xuất chứng cứ nhìn thấy được hay không và giúp phân biệt sự thay đổi trang với sự suy giảm mô hình.
Q: Tần suất nào nên chạy lại chuẩn web extraction?
Chạy lại nó sau khi có những thay đổi có ý nghĩa về mô hình, trình duyệt, lời nhắc, bộ sưu tập hoặc mẫu nguồn và theo lịch trình định kỳ phù hợp với tỷ lệ thay đổi của khối lượng công việc.




