Chi tiết bài crawl
Chi tiết bài crawl
Chi tiết bài crawl là màn đi sâu vào một URL hoặc bản ghi crawl cụ thể. Đây là nơi phù hợp cho người kiểm tra dữ liệu, người duyệt kỹ thuật hoặc người phụ trách nguồn dữ liệu khi cần biết quy trình đã bóc tách được gì.
Trên màn này thường có gì?
- thông tin URL nguồn và trạng thái tổng quát
- các chỉ số đếm như số mục dữ liệu tạm, nhóm dữ liệu, gói dữ liệu và mục cần duyệt liên quan
- bảng
Dữ liệu tạm (staging items) Tóm tắt nhóm dữ liệu (entity summary)Bản dữ liệu chuẩn bị đăng (bundle projection)Hàng chờ duyệt (review queue)- các URL liên quan và lịch sử phân tích gần đây
Khi nào cần vào màn này?
- màn Bài crawl chưa đủ để kết luận một bản ghi đã sẵn sàng chưa
- URL crawl bị lỗi, thiếu trường hoặc chất lượng dữ liệu tạm thấp
- cần xem quy trình đã tách dữ liệu theo từng nhóm nào
- cần biết gói dữ liệu nào đã được tạo hoặc đăng từ bản ghi này
Cách đọc theo thứ tự dễ hiểu
- Xem phần đầu trang và các chỉ số tổng quát.
- Kiểm tra
Dữ liệu tạm (staging items)để xem dữ liệu đã bóc tách ra sao. - So
Tóm tắt nhóm dữ liệu (entity summary)để biết nhóm dữ liệu nào đầy đủ, nhóm nào còn thiếu. - Xem
Hàng chờ duyệt (review queue)nếu bản ghi còn điểm cần duyệt. - Kiểm tra
Bản dữ liệu chuẩn bị đăng (bundle projection)và trạng thái đăng nếu URL đã đi xa trong pipeline.
Đây là màn nghiệp vụ sâu
Không phải biên tập viên nào cũng cần dùng màn này hằng ngày. Nó phù hợp hơn cho người phụ trách crawl, kiểm tra dữ liệu hoặc người đang xử lý sự cố quy trình.

