SSA + LoRA + фильтрация корпусов = 2–3 порядка выигрыша

Технические следствия эпистемологического барьера Если LLM принципиально остаются в плоскости оптимизации формы — соревнование сводится к эффективности вычислений. И здесь три архитектурных решения дают асимметричный ответ. 1. SSA: снижение сложности инференса Стандартное плотное внимание требует O(n²) операций. SSA снижает сложность до O(n·k), где k — число выбираемых токенов (константа). Эмпирические данные по архитектуре SubQ (2026): · 128K токенов — ускорение в 7.2 раза относительно FlashAttention-2 · 256K токенов — в 13.2 раза · 512K токенов — в 23.0 раза · 1M токенов — в 56.0 раз · 2M токенов — в 72.0 раза (оценка) Модель на 1M токенов запускается на 2–4 GPU, а не на кластере из сотен. Стоимость инференса падает с сотен долларов до центов. 2. Фильтрация корпусов по пропозициональной плотности · Удаление текстов с низкой долей предикативных структур · Сокращение объёма данных в 50–100 раз · Точность на RULER, GPQA не падает, иногда растёт за счёт снижения шума · Критерий — лингвистически обоснованный, а не чисто статистический 3. LoRA / NoRA / EfficientLoRA · Дообучение менее 1% параметров (ранговые матрицы A и B) · NoRA: замораживание внешних слоёв, серийная внутренняя структура — более точная адаптация при компактных обучаемых параметрах · EfficientLoRA: расширение ранга + прунинг + Sparse-Refined Straight-Through Estimator · Одна базовая модель + десятки адаптеров под задачи без перезагрузки · Дообучение на одном GPU за часы, а не на кластере за недели · Распространение адаптеров (мегабайты), а не модели (сотни гигабайт) Комбинированный эффект: · SSA-разреженность — снижение вычислений в 56–64 раза на длинных контекстах · Фильтрация корпуса — снижение объёма данных в 50–100 раз · LoRA/NoRA/EfficientLoRA — снижение памяти и времени тонкой настройки в 10–100 раз Итог: сокращение требований к оборудованию на 2–3 порядка. Это не компенсация грубой силой, а архитектурно обусловленный выигрыш. Стратегия для маломощных команд: · Интерпретация вместо генерации: качество разметки дискурса важнее размера модели · Локальные агенты с переключаемыми адаптерами · Детекторы скрытых сдвигов в синтаксических суперзнаках Сила не в количестве флопсов, а в понимании того, где кончается знак и начинается смысл. #AI #LLM #SSA #LoRA #MLOps #EfficientAI