Google Dorks Explained: Các toán tử tìm kiếm cho Nghiên cứu Web công khai
TL;DR
Google dorks là những kết hợp của các toán tử tìm kiếm thông thường của Google được sử dụng để thu hẹp kết quả công khai đã được lập chỉ mục.
Nghiên cứu an toàn bắt đầu với một miền mà bạn sở hữu hoặc được ủy quyền để đánh giá và tránh tìm kiếm các bí mật, thông tin xác thực, hồ sơ cá nhân hoặc hệ thống đã lộ diện.
Các toán tử hữu ích bao gồm site:, filetype:, các cụm từ được đặt trong dấu ngoặc kép, loại trừ với -, OR, intitle:, và inurl:.
Kết quả tìm kiếm là manh mối, không phải bằng chứng; hãy mở nguồn, xác minh ngữ cảnh, và ghi lại truy vấn và ngày truy cập.
Google dorks không vượt qua xác thực hoặc lấy nội dung mà Google không lập chỉ mục.
Google dorks là gì?
Google dorks là các truy vấn tìm kiếm chính xác kết hợp các từ khóa với các toán tử tìm kiếm được hỗ trợ để xác định các trang công khai, đã được lập chỉ mục cụ thể. Cụm từ này thường liên quan đến nghiên cứu bảo mật, nhưng các toán tử tương tự cũng hữu ích cho việc kiểm toán trang web, khám phá tài liệu, nghiên cứu hồ sơ công khai, và tìm kiếm nội dung cũ hoặc trùng lặp. Chỉ sử dụng chúng trong phạm vi được ủy quyền.
Nstdata Crawl chỉ có liên quan sau khi một tập hợp URL kết quả được sở hữu hoặc ủy quyền cần xem xét phạm vi trang; nó không phải là một công cụ toán tử tìm kiếm và không thay đổi ranh giới ủy quyền.
Google tài liệu các điều khiển tìm kiếm thông thường trong hướng dẫn tinh chỉnh tìm kiếm Google. Các đội phòng thủ cũng nên theo dõi , , và khi các phát hiện cần công bố.
Các toán tử tìm kiếm Google hoạt động như thế nào?
Các toán tử thêm các ràng buộc vào một truy vấn. site:example.com giới hạn kết quả vào một miền, filetype:pdf yêu cầu một định dạng tệp, các dấu ngoặc kép yêu cầu một cụm từ, -term loại trừ một thuật ngữ, và OR chấp nhận một trong hai biểu thức. intitle: và inurl: có thể thu hẹp văn bản tiêu đề hoặc URL, nhưng hành vi của toán tử và lập chỉ mục có thể thay đổi, vì vậy mỗi kết quả cần được xác minh thủ công.
Hướng dẫn chi tiết
Phương pháp 1: Kiểm toán tài liệu công khai trên một miền bạn kiểm soát
Bước 1: Giới hạn miền
Sử dụng site:docs.example.com với một thuật ngữ sản phẩm hoặc chính sách. Không bao giờ bắt đầu với các mẫu bí mật hoặc các miền bên thứ ba không liên quan.
Bước 2: Thu hẹp loại nội dung
Thêm một cụm từ được đặt trong dấu ngoặc kép hoặc một định dạng không gây hại như filetype:pdf để tìm các tài liệu, báo cáo, hoặc chính sách công khai.
Bước 3: Xác minh và ghi lại
Mở từng kết quả, xác nhận URL cuối cùng và chủ sở hữu trang, sau đó ghi lại truy vấn chính xác, ngày truy cập, mục đích và quyết định.
Phương pháp 2: Tìm các trang công khai cũ
Kết hợp site:example.com với các tên sản phẩm cũ, các đường dẫn đã hết hiệu lực, hoặc các cụm từ di sản đã biết. Xem xét một kết quả tìm kiếm như một manh mối; kiểm tra các chuyển hướng, thẻ canonical, điều hướng hiện tại, và xem liệu việc xóa có thực sự được dự định hay không.
Phương pháp 3: Xem xét phạm vi lập chỉ mục
Nhóm các truy vấn theo thư mục đã được phê duyệt và loại nội dung, sau đó so sánh kết quả với sơ đồ trang web và danh sách hàng hóa của trang. Số lượng kết quả của Google là ước lượng, vì vậy không sử dụng chúng như một cơ sở dữ liệu lập chỉ mục chính xác.
Xây dựng một Quy trình Dữ liệu Có giới hạn và Có thể đánh giá
Giữ các giới hạn thu thập, bằng chứng nguồn, trạng thái nhiệm vụ và xác thực luôn hiển thị từ yêu cầu đến bản ghi được chấp nhận.
Những gì nên không bao giờ được tìm kiếm hoặc thu thập?
Không sử dụng các toán tử tìm kiếm để săn lùng mật khẩu, khóa API, hồ sơ cá nhân, mã truy cập, trang quản trị bị lộ, tệp bí mật, hoặc hệ thống dễ bị tổn thương. Nếu công việc phòng thủ được ủy quyền tiết lộ thông tin nhạy cảm một cách bất ngờ, hãy dừng lại, bảo tồn bằng chứng tối thiểu, theo quy trình tiết lộ của tổ chức, và không tải xuống hoặc phân phối lại tài liệu.
Làm thế nào để duy trì một nhật ký nghiên cứu được ủy quyền?
Một nhật ký nghiên cứu được ủy quyền nên ghi lại chủ sở hữu đã phê duyệt công việc, các miền cho phép, mục đích, truy vấn, thời gian, URL kết quả, phân loại và hành động cuối cùng. Không sao chép nội dung trang vào nhật ký trừ khi đoạn trích tối thiểu cần thiết cho việc khắc phục. Sử dụng kiểm soát truy cập và thời gian lưu giữ ngắn vì ngay cả kết quả tìm kiếm vô hại cũng có thể tiết lộ các chi tiết cá nhân hoặc hoạt động.
Xem xét các kết quả dương tính giả trước khi nâng cao phát hiện. Một tên tệp giống như một chính sách cũ có thể đã chuyển hướng đến một tài liệu hiện tại, và một tiêu đề chứa “admin” có thể mô tả tài liệu công khai thay vì một giao diện quản trị. Xác minh URL cuối cùng, chủ sở hữu trang, loại nội dung, URL chính thức, và ngữ cảnh điều hướng mà không tìm kiếm thêm quyền truy cập.
Đối với các cuộc kiểm toán phòng thủ định kỳ, duy trì một danh mục truy vấn đã được phê duyệt và xem xét nó trước mỗi lần chạy. Loại bỏ các truy vấn tạo ra độ nhạy không cần thiết, ghi lại các thay đổi của toán tử, và so sánh các kết quả với sơ đồ trang web hiện tại và danh sách xuất bản của trang. Xem một URL mới hiển thị là một sự kiện xem xét, không tự động xem nó là một lỗ hổng.
Hướng dẫn thu thập dữ liệu tìm kiếm có trách nhiệm giải thích tại sao lập chỉ mục công khai, truy cập kỹ thuật và tái sử dụng hợp pháp là những câu hỏi riêng biệt. Đối với một cuộc kiểm toán trang đã được phê duyệt yêu cầu kiểm tra nhiều trang sở hữu, Nstdata Crawl có thể thu thập một danh mục miền có giới hạn sau khi các quy tắc bao gồm, loại trừ, chiều sâu, và số lượng trang được thiết lập.
Danh sách kiểm tra độ tin cậy của web-scraping và hướng dẫn thu thập web mở rộng cung cấp các kiểm soát bổ sung cho các cuộc kiểm toán có thể lặp lại và thu thập thông tin theo ràng buộc.
Kết luận
Google dorks được hiểu tốt nhất như là cú pháp tìm kiếm công khai chính xác, không phải là một kỹ thuật vượt qua. Bắt đầu với một miền đã sở hữu hoặc được ủy quyền, sử dụng các toán tử vô hại, xác minh từng kết quả trong ngữ cảnh, và duy trì một hồ sơ hẹp về mục đích và phát hiện.
Các toán tử tìm kiếm là các tính năng tìm kiếm thông thường, nhưng tính hợp pháp và chính sách phụ thuộc vào ý định, dữ liệu, ủy quyền, quyền tài phán, và các hành động sau đó.
H: Google dorks có vượt qua mật khẩu không?
Không. Google dorks lọc các kết quả đã được lập chỉ mục; chúng không vượt qua xác thực hoặc cấp quyền truy cập.
H: Tại sao một số toán tử lại ngừng hoạt động?
Google thay đổi hành vi lập chỉ mục và truy vấn, và các trang web có thể di chuyển hoặc biến mất, vì vậy kết quả từ toán tử không phải là một hợp đồng API ổn định.
H: Có thể sử dụng số lượng kết quả như các chỉ số chính xác không?
Không. Số lượng kết quả tìm kiếm là ước lượng và có thể thay đổi theo ngữ cảnh truy vấn, trạng thái chỉ mục và cách trình bày.
H: Bạn nên làm gì sau khi tìm thấy nội dung công khai không mong muốn?
Giảm thiểu truy cập, không chia sẻ nội dung, chỉ ghi lại bằng chứng cần thiết, và theo quy trình báo cáo an ninh hoặc quyền riêng tư của chủ sở hữu.
Thu thập toàn bộ trang web chỉ với một yêu cầu API
Tỷ lệ thành công 99,8% với kết xuất JavaScript
Nhận dữ liệu sạch, sẵn sàng cho LLM ở nhiều định dạng
Chuyển mọi trang web thành Markdown, HTML, JSON, liên kết, PDF và hơn thế nữa mà không cần quản lý hạ tầng thu thập dữ liệu.