Massive. Features include:
- 100,000 HD video sequences across many different conditions
- 2D Bounding Boxes annotated on 100,000 images
- 10,000 diverse images with pixel-level annotations
Comparable to Baidu's ApolloScape dataset which seeks 1M semantic images