В очередной раз достается медицинской диагностике от АИ-в этот раз модель o3 оказалась на ~80% эффективнее, чем средний практикующий врач-терапевт, у которого верный диагноз лишь в каждом пятом (!) случае ☕
Но настоящий скачок в качестве произошёл, когда над ответами стала работать система-оркестратор, имитирующая дискуссию нескольких виртуальных докторов, которые критиковали решения друг друга
Под управлением этого нейро-консилиума:
• o3 поднялась до 80 % точности и при этом сократила расходы на обследования почти вдвое;
• GPT-4o приблизилась к 60 %, потратив меньше денег, чем тот же врач;
• Gemini 2.5 Pro, Claude 4 Opus, Grok-3, DeepSeek R1 и Llama 4 Maverick получили прибавку качества примерно на 10% каждая.
В итоге, нейро-консилиум ставит диагноз верно в четырёх случаях из пяти, запрашивает меньше дорогостоящих анализов и, как показали тесты на 304 сложнейших клинических историях из журнала NEJM, обгоняет людей как по точности, так и по экономичности
Тут подробнее и с расчетами себестоимости
Подписывайтесь на Telegram Denis Sexy IT 🤖.