Perplexity протестировали GPT-6 Astra на своём бенчмарке WANDR — и она стала лучшей

Сегодня Perplexity опубликовали результаты тестирования новой модели OpenAI GPT-6 Astra на бенчмарке WANDR (Wide ANd Deep Research).Это довольно жёсткий тест на умение агента делать «широкий + глубокий» ресёрч: найти много сущностей, которые соответствуют критериям, потом по каждой собрать детальную информацию с источниками и доказательствами. Типичные задачи — маркет-маппинг, due diligence, поиск талантов, сравнение продуктов и т.д. Результаты:

  • GPT-6 Astra — 0.682 при стоимости $11.98 за задачу(самый высокий скор среди всех протестированных моделей)

Для сравнения:

  • Fable 5.1 — 0.601 за $12.76(Astra лучше на 13.5% и при этом дешевле на 6.1%)
  • Opus 5 — 0.537 за $11.60(Astra лучше на 27% при почти такой же цене)

На графике видно, как Astra вырывается вверх по качеству, оставаясь в разумном диапазоне стоимости.WANDR до сих пор был далеко от сатурации — раньше лучшие системы еле дотягивали до 0.36 soft F1. Скачок до 0.682 выглядит очень заметным. Похоже, OpenAI реально сделали сильный шаг именно в агентных сценариях, где нужно много ходить по вебу, собирать данные и проверять источники.

Perplexity протестировали GPT-6 Astra на своём бенчмарке WANDR — и она стала лучшей