Эпилог · 1943 → 2025

Куда всё это ведёт

Сквозные нити канона и честный взгляд на то, где сейчас фронтир.
Коротко. 59 работ — это не 59 отдельных идей, а несколько длинных нитей, которые тянутся сквозь десятилетия и переплетаются. Ниже — эти нити и то, куда они, судя по всему, ведут дальше. Без обещаний «AI изменит всё» — только то, что видно из самого канона.

Нити, которые тянутся сквозь канон

Аддитивный путь спасает градиент. Одна и та же математика «+1 в производной» всплывает трижды: constant-error-carousel в LSTM (ct = ct−1 + …, #11), identity-shortcut в ResNet (y = x + F(x), #27) и residual-обёртки в Transformer (#32). Глубину и длину удалось приручить не хитрой активацией, а прямым путём для градиента.

Масштаб — и его пределы. От «больше = лучше» (#37 Kaplan) к «растить данные наравне с параметрами» (#42 Chinchilla) и дальше — к упору в конечность данных, который открыл новую ось: тратить compute на инференс (#58 o1 / test-time). Каждый раз, когда одна ось масштабирования упирается в потолок, находится следующая.

Выравнивание упрощается. RLHF на PPO (#44, #33) → DPO убирает RL (#51) → Constitutional AI убирает человека из разметки (#45) → GRPO убирает критика (#59). Сложный трёхстадийный конвейер по частям разбирают на более дешёвые и стабильные куски.

KV-кэш — боттлнек инференса. Целая ветка Эпохи 6 борется за одно и то же: FlashAttention удешевляет вычисление внимания (#48), vLLM — управление кэшем (#49), GQA сокращает число KV-голов (#56), MLA сжимает каждую (#53), prefix caching и CacheBlend переиспользуют кэш между запросами (#54). Прогресс здесь — это классическая системная инженерия, а не новые архитектуры.

Идея ждёт субстрата. Свёртки LeNet-98 (#9) ждали GPU и данных до AlexNet-12 (#16); sparse-MoE 2017-го (#31) дозрела до Mixtral и DeepSeek (#52, #53). Правильная идея часто приходит на десятилетие раньше железа, которое даёт ей выстрелить.

Рассуждение как ресурс. Chain-of-Thought показал, что пошаговое рассуждение помогает (#43); o1 сделал его длину ручкой качества и научил RL (#58); R1 и GRPO дали открытый рецепт (#53, #59). «Думать дольше» превратилось из промпт-трюка в выучиваемую и масштабируемую способность.

Надёжность живёт в слое декодирования. Structured output (#55) напоминает: часть того, что делает LLM-системы пригодными для продакшена, рождается не в весах модели, а в обёртке вокруг неё — маске логитов, автомате, верификаторе.

Куда, судя по всему, дальше

Экстраполировать канон — дело неблагодарное (половина работ здесь была неожиданной для современников). Но несколько направлений видны прямо из его последних страниц:

Test-time compute и reasoning — самая свежая ось (#58, #59): вероятно, дальнейшее смещение «интеллекта» из обучения в инференс, поиск и верификацию, и борьба за то, чтобы это думание было дешёвым и надёжным.

Агенты и tool use — прямое продолжение structured output (#55) и function calling: LLM как компонент систем, вызывающих инструменты и действующих многошагово; здесь узкое место — надёжность и оценка, а не «интеллект» per se.

Эффективность инференса — ветка KV-кэша (#48–#57) не закрыта: длинный контекст, дешёвый сёрвинг и низкая латентность остаются ареной системной инженерии.

Дефицит данных (#42) толкает к синтетическим данным, обучению на собственных рассуждениях (как R1) и мультимодальности как новому источнику сигнала.

Что из этого окажется следующей «работой №60» — покажет время. Канон на то и канон, что дописывается.

Как читать дальше. Если проходили по порядку — вы прошли от первого формального нейрона (1943) до открытых reasoning-моделей (2025). Если прыгали по интересам — вернитесь к нитям выше и пройдите одну целиком: увидеть, как «аддитивный путь» или «борьба за KV-кэш» тянется сквозь эпохи, полезнее, чем любая отдельная работа.