CCBot
Common Crawl — kho dữ liệu mở mà rất nhiều mô hình AI dùng để huấn luyện.
Tuỳ bạn quyết định
Nhóm này thu thập hàng loạt để xây bộ dữ liệu, thường không dẫn nguồn về bạn. Chặn là lựa chọn hợp lý nếu bạn không muốn nội dung đi vào dữ liệu huấn luyện, và cũng hợp lý nếu bạn muốn giảm tải máy chủ.
Chặn nó thì mất gì
Chặn nó là cách gián tiếp nhưng hiệu quả để giữ nội dung khỏi nhiều bộ dữ liệu huấn luyện cùng lúc.
Dòng robots.txt cần viết
User-agent: CCBot
Allow: /User-agent: CCBot
Disallow: /Đặt đoạn này trước nhóm User-agent: * để chắc chắn nó được áp dụng.
Thông tin nhanh
- Nhà vận hành
- Common Crawl
- Nhóm
- Thu thập dữ liệu hàng loạt
- Mức độ quan trọng
- Ảnh hưởng đáng kể tới hiển thị AI
- Tuân thủ robots.txt
- Có
- Được tính trong điểm kiểm tra
- Không, chỉ hiển thị
CCBot có đọc được website của bạn không?
Kiểm tra trong 10 giây — không cần đăng ký. Công cụ chỉ ra đúng dòng luật đang quyết định điều đó.
Kiểm tra website của tôiBot khác nhóm Thu thập dữ liệu hàng loạt
Crawler của ByteDance (TikTok), thu thập dữ liệu cho mô hình AI.
Thu thập hình ảnh để xây dựng bộ dữ liệu.
Thu thập dữ liệu cho chỉ mục phi tập trung.
Thu thập nội dung để bán lại dưới dạng bộ dữ liệu.