Tuỳ bạn quyết định
Nhóm này thu thập hàng loạt để xây bộ dữ liệu, thường không dẫn nguồn về bạn. Chặn là lựa chọn hợp lý nếu bạn không muốn nội dung đi vào dữ liệu huấn luyện, và cũng hợp lý nếu bạn muốn giảm tải máy chủ.
Dòng robots.txt cần viết
User-agent: Timpibot
Allow: /User-agent: Timpibot
Disallow: /Đặt đoạn này trước nhóm User-agent: * để chắc chắn nó được áp dụng.
Thông tin nhanh
- Nhà vận hành
- Diffbot
- Nhóm
- Thu thập dữ liệu hàng loạt
- Mức độ quan trọng
- Tuỳ chọn — chặn hay mở đều hợp lý
- Tuân thủ robots.txt
- Có
- Được tính trong điểm kiểm tra
- Không, chỉ hiển thị
Timpibot có đọc được website của bạn không?
Kiểm tra trong 10 giây — không cần đăng ký. Công cụ chỉ ra đúng dòng luật đang quyết định điều đó.
Kiểm tra website của tôiBot khác của Diffbot
Trích xuất dữ liệu có cấu trúc, bán lại cho bên thứ ba.
Thu thập hình ảnh để xây dựng bộ dữ liệu.
Bot khác nhóm Thu thập dữ liệu hàng loạt
Common Crawl — kho dữ liệu mở mà rất nhiều mô hình AI dùng để huấn luyện.
Crawler của ByteDance (TikTok), thu thập dữ liệu cho mô hình AI.
Thu thập nội dung để bán lại dưới dạng bộ dữ liệu.