Достаточно ли идеальны современные нейроинтерфейсы для синтеза речи, неотличимой от настоящей речи человека?
Короткий ответ: нет, пока не достаточно, но прогресс за последние два года колоссальный. Современные инвазивные нейроинтерфейсы вплотную подошли к порогу «естественности», однако по ряду параметров — разборчивость в реальных условиях, долговечность, индивидуальная вариативность — синтезированная речь всё ещё отличается от настоящей человеческой.
Что уже достигнуто
Ключевой прорыв произошёл в 2025 году. Исследование, опубликованное в Nature в июне 2025 года, продемонстрировало brain-to-voice нейропротез, способный синтезировать речь с задержкой менее 25 миллисекунд — практически незаметной для человеческого восприятия. Участник с БАС (боковым амиотрофическим склерозом) смог не только произносить новые слова, но и задавать вопросы, менять интонацию и даже петь простые мелодии.
Технология Brain2voice 2.0 (2026) достигла 5,24% word error rate при транскрипции синтезированной речи наивными слушателями — это 8-кратное улучшение по сравнению с предыдущим уровнем в 43,75%. Для сравнения: разборчивость естественной дизартрической речи того же участника составляла всего около 4%. Иными словами, нейроинтерфейс уже превосходит саму «настоящую» речь человека с параличом речевого аппарата по разборчивости.
Система также научилась декодировать просодию — интонацию, ударение, ритм — что делает синтезированную речь не просто разборчивой, но и эмоционально выразительной. Исследователи подчёркивают, что это «ближайшая попытка воссоздать естественный, плавный разговор из одной лишь мысли».
Что ещё не идеально
Несмотря на впечатляющие цифры, несколько фундаментальных ограничений не позволяют назвать синтез «неотличимым от настоящей речи» в полном смысле.
Во-первых, контекст «настоящей речи». Речь идёт о сравнении с речью человека, потерявшего способность говорить. Для здорового человека, чья речь является эталоном, параметры могут быть иными. Интонационное богатство, микропаузы, тембровая окраска — всё это в синтезе пока воспроизводится приблизительно.
Во-вторых, технологические ограничения. Инвазивные массивы микроэлектродов требуют хирургической имплантации и со временем теряют сигнал. Неинвазивные подходы (ЭЭГ) пока дают заметно более скромные результаты: средний MOS (Mean Opinion Score) синтезированной речи составляет около 3,50, а лучший результат — 3,99 из 5,0. Это означает, что речь «понятна», но всё ещё воспринимается как синтетическая.
В-третьих, индивидуальная вариативность. Системы обучаются на данных конкретного пациента и требуют персонализации под его «доинсультный» голос. Универсального решения, работающего «из коробки» для любого человека, пока не существует.
В-четвёртых, долгосрочная стабильность. Нейропротезы тестируются в клинических условиях, но вопрос их надёжности при ежедневном использовании в течение лет остаётся открытым.
Итог
Современные нейроинтерфейсы для синтеза речи достигли уровня, при котором разборчивость синтезированной речи для людей с тяжёлыми нарушениями речи уже сопоставима или превосходит их собственную естественную речь. Однако для задачи «неотличимости от речи здорового человека» технология пока не созрела: неинвазивные методы дают MOS ниже 4,0, инвазивные требуют хирургии и персонализации, а долговременная стабильность не доказана. Мы находимся на пороге клинически жизнеспособных решений, но до полной «идеальности» — особенно в смысле универсальности и естественности для любого пользователя — ещё несколько лет целенаправленных исследований.