TL;DR
- Dữ liệu web cho đào tạo LLM chỉ có giá trị khi quyền, nguồn gốc, chất lượng và thời gian lưu trữ của nó được hiểu rõ. Khối lượng không khắc phục một tập hợp không được ủy quyền hoặc bị dán nhãn sai.
- Tách biệt việc thu thập, chuẩn hóa, loại bỏ trùng lặp, đánh giá chất lượng và phát hành tập dữ liệu. Mỗi giai đoạn cần có hồ sơ có thể được kiểm toán và đảo ngược.
- Nstdata Crawl có thể cung cấp tập hợp giới hạn từ web công cộng và các tài liệu có cấu trúc, nhưng nó không xác định được nội dung có bản quyền, đại diện hay phù hợp cho đào tạo mô hình hay không.
- Giữ lại URL nguồn, thời gian thu thập, quyết định chính sách, mã băm nội dung, ngôn ngữ và lý do loại trừ cho mỗi hồ sơ được giữ lại hoặc từ chối.
Chất lượng có nghĩa là gì đối với dữ liệu đào tạo LLM?
Chất lượng dữ liệu đào tạo LLM có nghĩa là hơn cả văn bản lưu loát. Một tập hợp hữu ích có nguồn gốc rõ ràng, cơ sở pháp lý được tài liệu hóa, liên quan đến nhiệm vụ mục tiêu, kiểm soát ngôn ngữ và định dạng, xử lý trùng lặp, và đủ siêu dữ liệu để loại bỏ dữ liệu sau này. Tổng quan của AWS về việc chuẩn bị tập dữ liệu LLM cũng tương tự định nghĩa việc trích xuất và thu thập như là khởi đầu của một pipeline chuẩn bị lớn hơn. Sản phẩm Crawl của Nstdata có thể cung cấp giai đoạn thu thập giới hạn, nhưng nó không thể quyết định xem một nguồn có thuộc về tập hợp của bạn hay không.
Một thất bại phổ biến là xem việc có sẵn công khai như là sự cho phép toàn diện. Đó không phải vậy. Điều khoản, bản quyền, luật riêng tư, hợp đồng, quyền của đối tượng dữ liệu, và quyền tài phán có thể thay đổi xem một trang có thuộc về một tập hợp đào tạo hay không. Tìm kiếm đánh giá pháp lý cho mô hình dự kiến, địa lý và kế hoạch phân phối.
Xây dựng chính sách thu thập trước khi thu thập
Định nghĩa một danh sách cho phép các nguồn, mục đích được phép, ngôn ngữ liên quan, thời gian lưu giữ, tiêu chí loại trừ, và một người chịu trách nhiệm cho các yêu cầu xóa. Sau đó, chuyển đổi chính sách đó thành các ranh giới thu thập. Một miền rộng thường hiếm khi là một phạm vi đủ; tài liệu, tin tức, hồ sơ người dùng, và các trang pháp lý có thể có các quyền và đặc điểm quyền riêng tư khác nhau.





