Mình vừa public bộ dữ liệu ~20GB Synthetic English OCR Detection & Recognition 120K.
📌 Update: data đã nâng lên 240k cặp dữ liệu và 40gb data
Mình vừa public bộ dữ liệu ~20GB Synthetic English OCR Detection & Recognition 120K.
Dataset gồm:
120.792 ảnh cho text detection
120.792 ảnh crop cho text recognition
Nhãn polygon nhiều điểm
File JSONL đầy đủ cho cả detector và recognizer
Phù hợp để train OCR, DBNet, CRNN, Transformer OCR, PaddleOCR hoặc model ONNX nhẹ
Dữ liệu được chia sẵn thành nhiều file ZIP, dễ tải và dễ xử lý.
GitHub: (https:// github . com/phiiggfdg/synthetic-ocr-en-det-rec-120k
Hugging Face: https:// huggingface .co/datasets/Phitran21/synthetic-ocr-en-det-rec-120k
Giấy phép: CC BY-NC 4.0 Được dùng cho nghiên cứu, học tập và dự án phi thương mại. Dùng thương mại cần liên hệ xin phép.
Nếu thấy hữu ích, cho mình xin một ⭐ bên GitHub và một ❤️ bên Hugging Face nhé.