Thư viện botThu thập dữ liệu hàng loạt

CCBot

Common Crawl — kho dữ liệu mở mà rất nhiều mô hình AI dùng để huấn luyện.

Common Crawl

Tuỳ bạn quyết định

Nhóm này thu thập hàng loạt để xây bộ dữ liệu, thường không dẫn nguồn về bạn. Chặn là lựa chọn hợp lý nếu bạn không muốn nội dung đi vào dữ liệu huấn luyện, và cũng hợp lý nếu bạn muốn giảm tải máy chủ.

Chặn nó thì mất gì

Chặn nó là cách gián tiếp nhưng hiệu quả để giữ nội dung khỏi nhiều bộ dữ liệu huấn luyện cùng lúc.

Dòng robots.txt cần viết

Cho phép
User-agent: CCBot
Allow: /
Chặn
User-agent: CCBot
Disallow: /

Đặt đoạn này trước nhóm User-agent: * để chắc chắn nó được áp dụng.

Thông tin nhanh

Nhà vận hành
Common Crawl
Nhóm
Thu thập dữ liệu hàng loạt
Mức độ quan trọng
Ảnh hưởng đáng kể tới hiển thị AI
Tuân thủ robots.txt
Được tính trong điểm kiểm tra
Không, chỉ hiển thị
Tài liệu chính thức của Common Crawl

CCBot có đọc được website của bạn không?

Kiểm tra trong 10 giây — không cần đăng ký. Công cụ chỉ ra đúng dòng luật đang quyết định điều đó.

Kiểm tra website của tôi

Bot khác nhóm Thu thập dữ liệu hàng loạt

Crawler của ByteDance (TikTok), thu thập dữ liệu cho mô hình AI.

Thu thập hình ảnh để xây dựng bộ dữ liệu.

Thu thập dữ liệu cho chỉ mục phi tập trung.

Thu thập nội dung để bán lại dưới dạng bộ dữ liệu.

5

công cụ đang chạy

miễn phí, không cần đăng ký

57

bot có hồ sơ đầy đủ

12 con quyết định việc được trích dẫn

Thư viện bot cập nhật 26/08/2026 · phiên bản 1.0.0. Số liệu đọc thẳng từ hệ thống; thời gian trung bình không tính các lượt lấy từ bộ nhớ đệm, vì chúng không chạy gì cả.

CCBot là gì? · Công cụ SEO MONA