WANDR: A Benchmark for Wide and Deep Research [data] [media]
Vitalii Polshkov, Marcin Pitera, Jeremy Yang, Kirill Priemko, Maksim Gaiduk, Aleks Nikolenko, Denis Bykov, Denis Yarats, Clare Southern, Jerry Ma
How AI Agents Reshape Knowledge Work: Autonomy, Efficiency, and Scope [media] [summary] [HBR]
Jeremy Yang, Kate Zyskowski, Noah Yonack, Jerry Ma
DRACO: a Cross-Domain Benchmark for Deep Research Accuracy, Completeness, and Objectivity [data] [media]
Joey Zhong, Hao Zhang, Clare Southern, Jeremy Yang, Thomas Wang, Kate Jung, Shu Zhang, Denis Yarats, Johnny Ho, Jerry Ma
The Adoption and Usage of AI Agents: Early Evidence from Perplexity [media] [summary]
Jeremy Yang, Noah Yonack, Kate Zyskowski, Denis Yarats, Johnny Ho, Jerry Ma
In collaboration with the team.
Q2D-Web: Evaluating First-Stage Retrievers at Scale
Optimizing On-Device Inference for Apple Silicon
A Local-First Agent for Private and Cost-Effective Knowledge Work
Brain: Agentic Memory as a Knowledge Wiki
Making SPACE: Secure and Efficient Runtimes for Long-Running Agents
WANDR Benchmark: Evaluating Research Agents That Must Search Wide and Deep
How AI Agents Reshape Knowledge Work
Evaluating Deep Research Performance in the Wild with the DRACO Benchmark