AI Training Dataset Catalog
Catalog of 100+ public datasets for AI training — size, format, license, quality metrics, and use cases.
Key Highlights
- ✓ 100+ public datasets cataloged
- ✓ Modality filtering (text, image, audio, video, multimodal)
- ✓ License and usage rights
- ✓ Quality and bias assessment scores
- ✓ Download links and API access
Overview
A curated catalog of 100+ public datasets for AI model training. Filterable by modality, size, license, quality score, and recommended use cases.
What's Inside
Dataset Categories
Text (Common Crawl, RedPajama, FineWeb), code (The Stack, CodeParrot), image (LAION, COCO, ImageNet), audio (LibriSpeech, MUSDB), video (WebVid, Panda-70M), and multimodal (LAION-5B, DataComp).
Quality Assessment
Each dataset is scored on deduplication status, contamination risk, license clarity, documentation quality, and known bias issues. Includes recommendations for pre-training vs. fine-tuning use cases.
Ready to dive in?
Explore this resource and discover more across our 12 technology frontiers.