Really cool! From my understanding, it looks like this is doing something like word embeddings and searching for nearby points in the embedding space.
Crazy idea: what if you used a dimensionality reduction like t-SNE instead of learning a vector representation? Would you expect similar results?