Сколько токенов в день обрабатывает мозг?

Дисклеймер: это не нейрофизиологическое измерение, а модельный расчет. Мы не измеряем физические величины напрямую, а переводим разные информационные потоки в условные токен-эквиваленты, чтобы сравнить порядки величин.

Сколько «токенов» проходит через голову обычного человека за сутки? Вопрос звучит как шутка из чата про нейросети и одновременно как вполне серьезный мысленный эксперимент. Человеческий мозг, конечно, не мыслит LLM-токенами: значительная часть его работы идет через образы, ощущения, эмоции и моторные программы.

Но что, если взять привычную единицу из мира языковых моделей — токен — и приложить ее к человеческому дню?

Получается неожиданно интересная и наглядная арифметика.

Давайте для начала посчитаем самый простой слой — речь, а затем посмотрим, что происходит, когда к словам добавляются глаза, уши, тело, нос и язык.

Если не хочется читать лонгрид
Если не хочется читать лонгрид

Часть 1. Только речь

Внутренний монолог

Допустим, человек спит восемь часов. Тогда бодрствование: 24 − 8 = 16 часов = 960 минут.

Обычная речь составляет примерно 120–180 слов в минуту. Возьмем среднее: 150 слов/мин.

Внутренний монолог идет не постоянно. Допустим, словесное мышление занимает около 35% времени бодрствования: 960 × 35% = 336 минут.

Тогда за день набирается порядка 336 × 150 = 50 400 слов.

Для английского языка одно слово в среднем занимает примерно 1,3 токена. Для нашего внутреннего монолога это: 50 400 × 1,3 ≈ 65 500 токенов.

Русский токенизируется менее экономно (санкции, не иначе!) — примерно 1,5–2 токена на слово. Если взять коэффициент 1,7: 50 400 × 1,7 ≈ 85 700 токенов в день.

Итак, что получается? В среднем сценарии — около 80 тысяч LLM-токенов внутренней речи в сутки. А при почти непрерывном бормотании с самим собой может доходить и до 200 тысяч.

  • Редкий внутренний монолог: 30–50 тыс. токенов в день.
  • Средний сценарий: 60–100 тыс.
  • Почти непрерывное словесное мышление: 150–200 тыс.

В нашем базовом сценарии получается около 80 тысяч LLM-токенов внутренней речи в сутки. Правда, в зависимости от того, насколько человек склонен мыслить словами, результат может отличаться в несколько раз.

Как-то маловато, да?

Диалог с людьми

Теперь добавим внешнюю речь: то, что мы произносим, пишем и слышим от других.

Исследование Матиаса Меля и соавторов дало оценку около 16 тысяч произнесенных слов в сутки среди участников исследования, хотя различия между людьми были очень большими. Исследование в Science / PubMed

Говорим и пишем

Если взять около 16 тысяч произнесенных слов в день и 1,5–2 токена на слово, получаем: 16 000 × 1,5–2 = 24–32 тыс. токенов.

Добавим немного переписки и округлим до 25–35 тысяч. У писателей, программистов и офисных работников письменная часть может заметно вырасти.

Слушаем чужую речь

Предположим, человек около трех часов в день слушает разговоры, подкасты, совещания, видео и просто болтовню рядом. При тех же 150 словах в минуту и 1,7 токена на русское слово: 3 × 60 × 150 × 1,7 = 45 900 токенов.

Итого диалоговый слой выглядит так:

· Произнесенные и написанные слова: 25–35 тыс. токенов в день.

  • Произнесенные и написанные слова: 25–35 тыс. токенов в день
  • Услышанная речь: ≈ 46 тыс.
  • Диалог вместе: ≈ 70–80 тыс.

А вся речь за день — так:

  • Внутренний монолог: ≈80 тыс. токенов.
  • Диалог — говорить и слушать: ≈70–80 тыс.
  • Вся речь: ≈150–160 тыс.

Ради красивой центральной цифры будем держать в голове около 150 тысяч LLM-токенов речевого дня.

За год: 150 000 × 365 ≈ 55 млн токенов.

За 80 лет, если детство не вычитать: 55 млн × 80 ≈ 4,4 млрд токенов.

Промежуточный вывод, от которого немного обидно

Суточный словесный поток человека — около 150 тыс. токенов — сопоставим по порядку величины с контекстным окном открытых моделей:

Llama 3.1 (2024 год, 128 тыс.), Qwen2.5 (2024 год, 128 тыс.), Qwen3 (2025 год, 128 тыс.) или Mistral Large 2 (2024 год, 128 тыс.).

Печально, но весь наш «словесный день» почти целиком помещается в один промпт. При этом модель получает этот контекст сразу и в явном виде, а человек удерживает в рабочей памяти лишь небольшую часть своего дневного опыта.

Весь словесный поток человека за жизнь — монолог плюс диалоги — это порядка нескольких миллиардов токенов. Для большой языковой модели это отнюдь не «океан опыта», а относительно небольшая часть обучающей выборки. Ну или сутки работы среднего вычислительного кластера.

Мы, кожаные мешки, на уровне речи генерим и перевариваем не так уж много токенов, увы!

Ну и прикольно, хотя и бесполезно, осознавать, что «русский» мозг по токенам речи обрабатывает больше объема, чем «английский». Шутка! Мы же все понимаем, что это мысленный эксперимент с допущениями?

«Да, — скажете вы. — Но мы же люди! Мы чувствуем!» Окей.

Давайте посчитаем, в каком объеме наш мозг обрабатывает сенсорику

Часть 2. Остальные чувства

Тут появляется важное разделение на несколько слоев:

  • Сырой сенсорный поток: сигналы от зрения, слуха, тактильности, мышц тела, обоняния, вкуса и внутренних органов.
  • Обработанная модель мира: объекты, события, движения и ощущения, на которые мозг реально обращает внимание.
  • Словесное мышление: то, что мы уже посчитали в первой части.

Считать тут имеет смысл двумя способами: по сырому потоку и по условным «смысловым единицам». Эмоции сюда тоже войдут, но не как отдельный орган чувств.

Сырой сенсорный поток

Для мысленного эксперимента примем следующие вводные:

  • 16 часов бодрствования = 57 600 секунд;\
  • активно смотрим на мир примерно 14 часов — остальное спишем на моргание, душ, полумрак и сладкий послеобеденный сон;
  • для грубой арифметики договоримся считать один токен эквивалентом 8 бит новой информации. Это условный коэффициент пересчета, а не свойство токенов или мозга;
  • оценку пропускной способности органов чувств берем очень грубо.

Зрение

После первичной обработки сетчаткой зрительный нерв передает порядка 10 000 000 бит/с.

За 14 часов: 10 000 000 × 50 400 = 504 000 000 000 бит. Как бы немало!

В условных токенах: 504 млрд бит / 8 = 63 млрд токенов в сутки.

Слух

Здесь считаем весь акустический поток: речь, музыку, шумы, сигналы машин, шорохи и интонации. Смысл услышанных слов отдельно учтем в языковом слое.

Условная полезная пропускная способность слуха — около 100 000 бит/с.

За 16 часов: 100 000 × 57 600 = 5,76 млрд бит.

Или: 5,76 млрд / 8 = 0,72 млрд токенов в сутки. Посчитайте сами, если не верите.

Тело

Сюда входят осязание, температура, боль, положение суставов, напряжение мышц, равновесие и внутренние сигналы организма. Примем суммарный поток равным примерно 1 000 000 бит/с.

Тогда: 1 000 000 × 57 600 = 57,6 млрд бит.

Или: 57,6 млрд / 8 = 7,2 млрд токенов в сутки.

Обоняние

Условно примем пропускную способность обонятельной системы в 10–100 тыс. бит/с, средняя оценка — 50 тыс. бит/с.

За 16 часов: 50 000 × 57 600 = 2,88 млрд бит.

Если условный токен соответствует 8 битам, получаем: 2,88 млрд / 8 = 360 млн токен-эквивалентов в сутки.

Сводно по этим каналам — уже после заметного периферического сжатия — получается порядка 71 млрд токен-эквивалентов в день:

  • Зрение: 63 млрд.
  • Тело: 7,2 млрд.
  • Слух: 0,72 млрд.
  • Обоняние: 0,36 млрд.

Но около 70 миллиардов — это крайне скромный сценарий. Если считать сигналы ближе к уровню сенсорных рецепторов, Zheng и Meister получают около миллиарда бит в секунду. За день это уже 7,2 триллиона условных токенов. Не мозг, а небольшая серверная стойка из мяса. Статья в Neuron

Таким образом, 70 млрд токенов описывают более поздний уровень сигнала, уже после значительного периферического сжатия. Разумный диапазон: 100 млрд–10 трлн сырых токен-эквивалентов в день.

Те же авторы, Zheng и Meister, оценивают поведенчески выражаемую информацию примерно в 10 бит/с. Получается разрыв с сенсорным входом примерно в сто миллионов раз. Но эта цифра относится скорее к измеряемому поведению, чем ко всему мышлению, и уже вызвала научные возражения. Подавать ее как установленную скорость мы не будем. Научный комментарий с критикой оценки

И еще: почти весь поток многократно повторяется. Если смотреть на стену десять секунд, нервная система продолжает передавать огромное количество данных, хотя новой смысловой информации почти нет. Обоняние тут особенно показательно: система быстро адаптируется к постоянному запаху и перестает напоминать о нем каждую миллисекунду, пока не появится новый стимул.

Получается занятная картина: сознание видит тонкую струйку, отфильтрованную мозгом, а под капотом ревет информационный водопад. И пока внутренний голос неторопливо формулирует одну мысль, остальной мозг уже успел проверить равновесие, положение тела, выражение лица собеседника и подозрительный звук за спиной.

Эмоции и мотивация

Здесь отдельный битрейт назначить невозможно. Эмоция — не самостоятельный орган чувств, а распределенное состояние системы, возникающее из восприятия, памяти, оценки ситуации, сигналов тела и работы нейромедиаторов и гормонов. Поэтому добавлять эмоции к зрению и телу как еще один независимый поток было бы двойным счетом.

У эмоций другая функция: они меняют вес информации. Звук может быть почти незаметным или мгновенно захватить все внимание, если мозг распознает в нем угрозу. Поэтому эмоции лучше представить как механизм приоритизации, который определяет, какие токены будут замечены, запомнены и превратятся в действие.

А теперь переведем ощущения на язык токенов

Дальше — самая игровая часть расчета. Мы сами назначаем условную стоимость фиксации взгляда, телесного изменения и запаха. Получившиеся цифры нельзя проверить прибором: они нужны только для оценки порядка величины.

Зрение

Предположим:

  • активно смотрим 840 минут;
  • 2,5 зрительной фиксации в секунду;
  • одна фиксация соответствует примерно 50 мультимодальным токенам;
  • только 10% информации действительно новая, остальное предсказывается мозгом.

840 × 60 × 2,5 × 50 × 0,1 = 630 000 токенов.

Получаем примерно 630 тысяч условных зрительных смысловых единиц.

Слух без языкового смысла

Музыка, шумы, сигналы и окружающие события — без учета слов, которые уже сидят в речевом слое: ≈10 000 токенов.

Тело и движение

Предположим:

  • 10 часов человек более или менее активен;
  • мозг фиксирует одно значимое изменение состояния в секунду;
  • каждое изменение содержит около 5 условных единиц.

10 × 3600 × 5 = 180 000 токенов.

Добавим около 20 тысяч токенов на голод, усталость, температуру, дыхание, дискомфорт и другие внутренние ощущения. Итого тело: ≈200 000 токенов.

Запах и вкус

Запахи: помещение и улица, еда и напитки, люди, транспорт, парфюм, дым, сырость, химия, собственное тело. Плюс вкус: за пределами приемов пищи вкусовой канал почти не создает новых событий. Если принять три-четыре приема пищи по несколько сотен различимых изменений вкуса и текстуры, получится порядка 1–5 тысяч условных смысловых единиц в день. Значительную часть того, что мы называем вкусом, при этом создает обоняние.

Вместе разумный диапазон: 2–10 тысяч условных единиц запаха и вкуса в день.

Что получается по игровой модели

Если собрать ранее перечисленные источники — зрение, тело, движение, речь, слух, запах и вкус, — человек «вытуживает» около 1,0 млн токенов в день:

  • Зрение: 630 тыс.
  • Тело и движение: 200 тыс.
  • Речь — монолог и диалог: ≈150 тыс.
  • Слух без языкового смысла: ≈10 тыс.
  • Запах и вкус: 2–10 тыс.

ТОТАЛ ≈1,0 млн.

Центральная «игровая» оценка — около миллиона условных смысловых единиц, или токенов, в день. С учетом всех допущений разумный диапазон — 300 тысяч–3 миллиона токенов в сутки.

Итого: от триллионов сигналов до одной мысли

Оценка за 16 часов бодрствования:

  • Сырой сенсорный поток: 100 млрд–10 трлн токен-эквивалентов.
  • Условные смысловые единицы: 300 тыс.–3 млн.
  • Языковая обработка: 100–200 тыс. токенов.
  • Произнесенная и написанная речь: 25–35 тыс. токенов.
  • Измеряемый поведенческий выход: порядка 100 тыс. информационных токен-эквивалентов.

В рамках этой модели до уровня явного смыслового представления доходит лишь малая доля сырого потока. Остальное не обязательно отбрасывается: оно может использоваться для бессознательной обработки, управления телом, предсказания и фильтрации изменений.

Так сколько же токенов в человеке?

Однозначного числа у ученых нет. Но, судя по модели, на уровне речи мы пропускаем через себя около 150 тысяч токенов в день. На уровне условных смысловых единиц — около миллиона. А ближе к сенсорным рецепторам счет может идти на десятки миллиардов и триллионы токенов.

И весь этот объем обслуживает биологическое устройство с энергопотреблением примерно как у тусклой лампочки. Оно не просто продолжает текст по входному контексту, как обычная LLM: оно одновременно видит, слышит, держит равновесие, вспоминает прошлое, замечает опасность и реагирует на боль, перестраивается на ходу и управляет телом, которое каждую секунду может изменить окружающий мир.

Да, конечно, компьютерный ИИ уже читает быстрее нас, помнит больше текста и не забывает пароль через десять секунд после его смены. Но огромный контекст еще не равен опыту, а быстрый ответ — самостоятельному пониманию того, что сейчас важно. Между обработкой токенов и существованием в мире все еще лежит приличная технологическая пропасть.

Так что, друзья, списывать человеческий мозг в утиль истории рано. Это биологическое устройство массой около 1,4 килограмма при энергопотреблении около 20 ватт непрерывно обрабатывает и эффективно фильтрует триллионы сигналов, превращает их в несколько важных мыслей, связывает с памятью и придает им эмоциональный вкус.

А затем заставляет встать с дивана и пойти на пробежку.

И какой ИИ сейчас может сделать то же самое?

ИИ еще есть куда расти. Настоящая суперсила мозга заключается не в том, чтобы переварить максимум токенов и ответить на них следующим токеном, а в том, чтобы понять, какие из них имеют значение, и выполнить реальное действие.

Красильников Сергей
co-founder, Технический директор Aintelliq

Есть ощущение, что ребенок до 3-х лет обрабатывает кратно больше токенов, чем взрослый.

Будем считать?
Да, однозначно
Нет, мне бы со взрослыми разобраться
Есть идея лучше! Напишу в комментарии