As a computer vision guy I'm sad JEPA didn't end up more effective. Makes perfect sense conceptually, would have easily transferred to video, but other self-supervised methods just seem to beat it!
Yeah! JEPA seems awesome. Do you mind sharing what other self-supervised methods work better than JEPA?