Обзор ChatGPT 5.6: тестирование, производительность и промпты
Первые впечатление от ChatGPT 5.6
Все выходные без отдыха я нещадно сжигал на тесты лимиты максимальной подписки. Сжёг почти недельный лимит, благо сегодня его сбросили
1. Все модели семейства ChatGPT 5.6 очень исполнительны
Это плюс для решения задач по спецификации и минус, когда надо сделать что-то хорошо на ходу
Пример: гонял аудит сложного кода через Opus, Fable, Terra и Sol. Все кроме Opus нашли одну проблему, но только Fable подумал, а что если этот же класс проблем есть в смежных зонах, докопался и нашёл еще баг с той же природой
2. У них повышенные требования к промптам
Если с Fable в большинстве случаев достаточно простым языком объяснить, что делать, то чтобы добиться схожих по уровню результатов от 5.6 Sol нужны заморочки с промптами
Самому промпты писать не надо, достаточно сформировать правила по их написанию. Для этого я скормил Fable системную карточку и гайд, описал чего мне не хватает в работе модели и попросил сделать универсальный шаблон промпта, который подтянет самостоятельность моделей ChatGPT до нужного мне уровня
3. Младшие модели нет смысла использовать в разработке
В семействе 3 модели: Luna, Terra и Sol. Подразумевается, что Luna надо использовать для простых задач, Terra гонять как рабочую лошадку для большинства, а Sol включать только на самые сложные задачи
Я пробовал решить одни и те же задачи разными комбинация агентов, а потом сравнивал результаты. В идеале хотелось добиться топ качества при меньшем расходе лимитов. Luna после трех прогонов отвалилась сразу. А вот между Terra и Sol пришлось выбирать
Основной вопрос был такой: будет ли то же качество, если решать задачу средним агентом, а потом пускать поверх него сильных аудиторов против варианта, когда все агенты в цепочке сразу сильные. Пробовал Luna Max, Terra High и Xhigh, Sol Medium и Sol Xhigh как рабочую лошадку. За рабочей лошадкой в цикле всегда запускались два аудитора: Terra Xhigh и Sol Xhigh. А после аудита совокупное качество решения задачи сравнивал Fable. В итоге, остановился на том, что магии нет и оптимальный формат, если задачу решает сразу Sol Xhigh. Он и сам не сильно дороже получается, потому что быстрее находит решение, и аудиторы после него тратят меньше токенов, потому что исходное решение сильнее
Подписывайтесь на Telegram Александр Львов.