Сколько токенов в день обрабатывает мозг?
Дисклеймер: это не нейрофизиологическое измерение, а модельный расчет. Мы не измеряем физические величины напрямую, а переводим разные информационные потоки в условные токен-эквиваленты, чтобы сравнить порядки величин.
Сколько «токенов» проходит через голову обычного человека за сутки? Вопрос звучит как шутка из чата про нейросети и одновременно как вполне серьезный мысленный эксперимент. Человеческий мозг, конечно, не мыслит LLM-токенами: значительная часть его работы идет через образы, ощущения, эмоции и моторные программы.
Но что, если взять привычную единицу из мира языковых моделей — токен — и приложить ее к человеческому дню?
Получается неожиданно интересная и наглядная арифметика.
Давайте для начала посчитаем самый простой слой — речь, а затем посмотрим, что происходит, когда к словам добавляются глаза, уши, тело, нос и язык.
Часть 1. Только речь
Внутренний монолог
Допустим, человек спит восемь часов. Тогда бодрствование: 24 − 8 = 16 часов = 960 минут.
Обычная речь составляет примерно 120–180 слов в минуту. Возьмем среднее: 150 слов/мин.
Внутренний монолог идет не постоянно. Допустим, словесное мышление занимает около 35% времени бодрствования: 960 × 35% = 336 минут.
Тогда за день набирается порядка 336 × 150 = 50 400 слов.
Для английского языка одно слово в среднем занимает примерно 1,3 токена. Для нашего внутреннего монолога это: 50 400 × 1,3 ≈ 65 500 токенов.
Русский токенизируется менее экономно (санкции, не иначе!) — примерно 1,5–2 токена на слово. Если взять коэффициент 1,7: 50 400 × 1,7 ≈ 85 700 токенов в день.
Итак, что получается? В среднем сценарии — около 80 тысяч LLM-токенов внутренней речи в сутки. А при почти непрерывном бормотании с самим собой может доходить и до 200 тысяч.
- Редкий внутренний монолог: 30–50 тыс. токенов в день.
- Средний сценарий: 60–100 тыс.
- Почти непрерывное словесное мышление: 150–200 тыс.
В нашем базовом сценарии получается около 80 тысяч LLM-токенов внутренней речи в сутки. Правда, в зависимости от того, насколько человек склонен мыслить словами, результат может отличаться в несколько раз.
Как-то маловато, да?
Диалог с людьми
Теперь добавим внешнюю речь: то, что мы произносим, пишем и слышим от других.
Исследование Матиаса Меля и соавторов дало оценку около 16 тысяч произнесенных слов в сутки среди участников исследования, хотя различия между людьми были очень большими. Исследование в Science / PubMed
Говорим и пишем
Если взять около 16 тысяч произнесенных слов в день и 1,5–2 токена на слово, получаем: 16 000 × 1,5–2 = 24–32 тыс. токенов.
Добавим немного переписки и округлим до 25–35 тысяч. У писателей, программистов и офисных работников письменная часть может заметно вырасти.
Слушаем чужую речь
Предположим, человек около трех часов в день слушает разговоры, подкасты, совещания, видео и просто болтовню рядом. При тех же 150 словах в минуту и 1,7 токена на русское слово: 3 × 60 × 150 × 1,7 = 45 900 токенов.
Итого диалоговый слой выглядит так:
· Произнесенные и написанные слова: 25–35 тыс. токенов в день.
- Произнесенные и написанные слова: 25–35 тыс. токенов в день
- Услышанная речь: ≈ 46 тыс.
- Диалог вместе: ≈ 70–80 тыс.
А вся речь за день — так:
- Внутренний монолог: ≈80 тыс. токенов.
- Диалог — говорить и слушать: ≈70–80 тыс.
- Вся речь: ≈150–160 тыс.
Ради красивой центральной цифры будем держать в голове около 150 тысяч LLM-токенов речевого дня.
За год: 150 000 × 365 ≈ 55 млн токенов.
За 80 лет, если детство не вычитать: 55 млн × 80 ≈ 4,4 млрд токенов.
Промежуточный вывод, от которого немного обидно
Суточный словесный поток человека — около 150 тыс. токенов — сопоставим по порядку величины с контекстным окном открытых моделей:
Llama 3.1 (2024 год, 128 тыс.), Qwen2.5 (2024 год, 128 тыс.), Qwen3 (2025 год, 128 тыс.) или Mistral Large 2 (2024 год, 128 тыс.).
Печально, но весь наш «словесный день» почти целиком помещается в один промпт. При этом модель получает этот контекст сразу и в явном виде, а человек удерживает в рабочей памяти лишь небольшую часть своего дневного опыта.
Весь словесный поток человека за жизнь — монолог плюс диалоги — это порядка нескольких миллиардов токенов. Для большой языковой модели это отнюдь не «океан опыта», а относительно небольшая часть обучающей выборки. Ну или сутки работы среднего вычислительного кластера.
Мы, кожаные мешки, на уровне речи генерим и перевариваем не так уж много токенов, увы!
Ну и прикольно, хотя и бесполезно, осознавать, что «русский» мозг по токенам речи обрабатывает больше объема, чем «английский». Шутка! Мы же все понимаем, что это мысленный эксперимент с допущениями?
«Да, — скажете вы. — Но мы же люди! Мы чувствуем!» Окей.
Часть 2. Остальные чувства
Тут появляется важное разделение на несколько слоев:
- Сырой сенсорный поток: сигналы от зрения, слуха, тактильности, мышц тела, обоняния, вкуса и внутренних органов.
- Обработанная модель мира: объекты, события, движения и ощущения, на которые мозг реально обращает внимание.
- Словесное мышление: то, что мы уже посчитали в первой части.
Считать тут имеет смысл двумя способами: по сырому потоку и по условным «смысловым единицам». Эмоции сюда тоже войдут, но не как отдельный орган чувств.
Сырой сенсорный поток
Для мысленного эксперимента примем следующие вводные:
- 16 часов бодрствования = 57 600 секунд;\
- активно смотрим на мир примерно 14 часов — остальное спишем на моргание, душ, полумрак и сладкий послеобеденный сон;
- для грубой арифметики договоримся считать один токен эквивалентом 8 бит новой информации. Это условный коэффициент пересчета, а не свойство токенов или мозга;
- оценку пропускной способности органов чувств берем очень грубо.
Зрение
После первичной обработки сетчаткой зрительный нерв передает порядка 10 000 000 бит/с.
За 14 часов: 10 000 000 × 50 400 = 504 000 000 000 бит. Как бы немало!
В условных токенах: 504 млрд бит / 8 = 63 млрд токенов в сутки.
Слух
Здесь считаем весь акустический поток: речь, музыку, шумы, сигналы машин, шорохи и интонации. Смысл услышанных слов отдельно учтем в языковом слое.
Условная полезная пропускная способность слуха — около 100 000 бит/с.
За 16 часов: 100 000 × 57 600 = 5,76 млрд бит.
Или: 5,76 млрд / 8 = 0,72 млрд токенов в сутки. Посчитайте сами, если не верите.
Тело
Сюда входят осязание, температура, боль, положение суставов, напряжение мышц, равновесие и внутренние сигналы организма. Примем суммарный поток равным примерно 1 000 000 бит/с.
Тогда: 1 000 000 × 57 600 = 57,6 млрд бит.
Или: 57,6 млрд / 8 = 7,2 млрд токенов в сутки.
Обоняние
Условно примем пропускную способность обонятельной системы в 10–100 тыс. бит/с, средняя оценка — 50 тыс. бит/с.
За 16 часов: 50 000 × 57 600 = 2,88 млрд бит.
Если условный токен соответствует 8 битам, получаем: 2,88 млрд / 8 = 360 млн токен-эквивалентов в сутки.
Сводно по этим каналам — уже после заметного периферического сжатия — получается порядка 71 млрд токен-эквивалентов в день:
- Зрение: 63 млрд.
- Тело: 7,2 млрд.
- Слух: 0,72 млрд.
- Обоняние: 0,36 млрд.
Но около 70 миллиардов — это крайне скромный сценарий. Если считать сигналы ближе к уровню сенсорных рецепторов, Zheng и Meister получают около миллиарда бит в секунду. За день это уже 7,2 триллиона условных токенов. Не мозг, а небольшая серверная стойка из мяса. Статья в Neuron
Таким образом, 70 млрд токенов описывают более поздний уровень сигнала, уже после значительного периферического сжатия. Разумный диапазон: 100 млрд–10 трлн сырых токен-эквивалентов в день.
Те же авторы, Zheng и Meister, оценивают поведенчески выражаемую информацию примерно в 10 бит/с. Получается разрыв с сенсорным входом примерно в сто миллионов раз. Но эта цифра относится скорее к измеряемому поведению, чем ко всему мышлению, и уже вызвала научные возражения. Подавать ее как установленную скорость мы не будем. Научный комментарий с критикой оценки
И еще: почти весь поток многократно повторяется. Если смотреть на стену десять секунд, нервная система продолжает передавать огромное количество данных, хотя новой смысловой информации почти нет. Обоняние тут особенно показательно: система быстро адаптируется к постоянному запаху и перестает напоминать о нем каждую миллисекунду, пока не появится новый стимул.
Получается занятная картина: сознание видит тонкую струйку, отфильтрованную мозгом, а под капотом ревет информационный водопад. И пока внутренний голос неторопливо формулирует одну мысль, остальной мозг уже успел проверить равновесие, положение тела, выражение лица собеседника и подозрительный звук за спиной.
Эмоции и мотивация
Здесь отдельный битрейт назначить невозможно. Эмоция — не самостоятельный орган чувств, а распределенное состояние системы, возникающее из восприятия, памяти, оценки ситуации, сигналов тела и работы нейромедиаторов и гормонов. Поэтому добавлять эмоции к зрению и телу как еще один независимый поток было бы двойным счетом.
У эмоций другая функция: они меняют вес информации. Звук может быть почти незаметным или мгновенно захватить все внимание, если мозг распознает в нем угрозу. Поэтому эмоции лучше представить как механизм приоритизации, который определяет, какие токены будут замечены, запомнены и превратятся в действие.
А теперь переведем ощущения на язык токенов
Дальше — самая игровая часть расчета. Мы сами назначаем условную стоимость фиксации взгляда, телесного изменения и запаха. Получившиеся цифры нельзя проверить прибором: они нужны только для оценки порядка величины.
Зрение
Предположим:
- активно смотрим 840 минут;
- 2,5 зрительной фиксации в секунду;
- одна фиксация соответствует примерно 50 мультимодальным токенам;
- только 10% информации действительно новая, остальное предсказывается мозгом.
840 × 60 × 2,5 × 50 × 0,1 = 630 000 токенов.
Получаем примерно 630 тысяч условных зрительных смысловых единиц.
Слух без языкового смысла
Музыка, шумы, сигналы и окружающие события — без учета слов, которые уже сидят в речевом слое: ≈10 000 токенов.
Тело и движение
Предположим:
- 10 часов человек более или менее активен;
- мозг фиксирует одно значимое изменение состояния в секунду;
- каждое изменение содержит около 5 условных единиц.
10 × 3600 × 5 = 180 000 токенов.
Добавим около 20 тысяч токенов на голод, усталость, температуру, дыхание, дискомфорт и другие внутренние ощущения. Итого тело: ≈200 000 токенов.
Запах и вкус
Запахи: помещение и улица, еда и напитки, люди, транспорт, парфюм, дым, сырость, химия, собственное тело. Плюс вкус: за пределами приемов пищи вкусовой канал почти не создает новых событий. Если принять три-четыре приема пищи по несколько сотен различимых изменений вкуса и текстуры, получится порядка 1–5 тысяч условных смысловых единиц в день. Значительную часть того, что мы называем вкусом, при этом создает обоняние.
Вместе разумный диапазон: 2–10 тысяч условных единиц запаха и вкуса в день.
Что получается по игровой модели
Если собрать ранее перечисленные источники — зрение, тело, движение, речь, слух, запах и вкус, — человек «вытуживает» около 1,0 млн токенов в день:
- Зрение: 630 тыс.
- Тело и движение: 200 тыс.
- Речь — монолог и диалог: ≈150 тыс.
- Слух без языкового смысла: ≈10 тыс.
- Запах и вкус: 2–10 тыс.
ТОТАЛ ≈1,0 млн.
Центральная «игровая» оценка — около миллиона условных смысловых единиц, или токенов, в день. С учетом всех допущений разумный диапазон — 300 тысяч–3 миллиона токенов в сутки.
Итого: от триллионов сигналов до одной мысли
Оценка за 16 часов бодрствования:
- Сырой сенсорный поток: 100 млрд–10 трлн токен-эквивалентов.
- Условные смысловые единицы: 300 тыс.–3 млн.
- Языковая обработка: 100–200 тыс. токенов.
- Произнесенная и написанная речь: 25–35 тыс. токенов.
- Измеряемый поведенческий выход: порядка 100 тыс. информационных токен-эквивалентов.
В рамках этой модели до уровня явного смыслового представления доходит лишь малая доля сырого потока. Остальное не обязательно отбрасывается: оно может использоваться для бессознательной обработки, управления телом, предсказания и фильтрации изменений.
Так сколько же токенов в человеке?
Однозначного числа у ученых нет. Но, судя по модели, на уровне речи мы пропускаем через себя около 150 тысяч токенов в день. На уровне условных смысловых единиц — около миллиона. А ближе к сенсорным рецепторам счет может идти на десятки миллиардов и триллионы токенов.
И весь этот объем обслуживает биологическое устройство с энергопотреблением примерно как у тусклой лампочки. Оно не просто продолжает текст по входному контексту, как обычная LLM: оно одновременно видит, слышит, держит равновесие, вспоминает прошлое, замечает опасность и реагирует на боль, перестраивается на ходу и управляет телом, которое каждую секунду может изменить окружающий мир.
Да, конечно, компьютерный ИИ уже читает быстрее нас, помнит больше текста и не забывает пароль через десять секунд после его смены. Но огромный контекст еще не равен опыту, а быстрый ответ — самостоятельному пониманию того, что сейчас важно. Между обработкой токенов и существованием в мире все еще лежит приличная технологическая пропасть.
Так что, друзья, списывать человеческий мозг в утиль истории рано. Это биологическое устройство массой около 1,4 килограмма при энергопотреблении около 20 ватт непрерывно обрабатывает и эффективно фильтрует триллионы сигналов, превращает их в несколько важных мыслей, связывает с памятью и придает им эмоциональный вкус.
А затем заставляет встать с дивана и пойти на пробежку.
И какой ИИ сейчас может сделать то же самое?
ИИ еще есть куда расти. Настоящая суперсила мозга заключается не в том, чтобы переварить максимум токенов и ответить на них следующим токеном, а в том, чтобы понять, какие из них имеют значение, и выполнить реальное действие.