X · @perplexity_ai
· X / Twitter
Re WANDR tests how well agents discover large sets of entities and verify specific facts about each one. It provides a dense, interpretable eval signa…
Re WANDR tests how well agents discover large sets of entities and verify specific facts about each one. It provides a dense, interpretable eval signal that reveals whether an agent fails, and where.The pipeline also doubles as a semi-automated factory for training data.