Эпоха 6 · Генеративка и системы · 2024 / 2025

53 DeepSeek V3 / R1

DeepSeek-V3 Technical Report (дек 2024) · DeepSeek-R1 (янв 2025) · DeepSeek-AI
🟧 оригинал выборочно~2–3 чоригинал ↗
Суть за 20 секунд. V3 — 671B MoE (37B активных) с Multi-head Latent Attention и балансировкой без auxiliary loss; сильная open-weight модель за (заявленно) скромный compute. R1 — рассуждение, выросшее из ЧИСТОГО RL на верифицируемых наградах: самопроверка возникает сама. Уровень OpenAI o1, открытые веса.

Контекст

К 2024–25 фронтир был в основном закрытым (GPT-4, Claude, Gemini). DeepSeek выпускает открытые модели близкого уровня и громко заявляет о низкой стоимости обучения.

Идея и механизм

V3 — база: 671B-параметрный MoE (активны ~37B на токен) с двумя инженерными изюминами — Multi-head Latent Attention (MLA) и балансировкой нагрузки экспертов без вспомогательного лосса. R1 — reasoning: сильное рассуждение выращивается почти чистым RL на верифицируемых наградах (RLVR), вплоть до варианта R1-Zero без предварительного SFT.

обучение с подкреплением MLA (сжатие KV) и RLVR (рассуждение из RL)

MLA — Multi-head Latent Attention. Вместо кэширования полных K, V по всем головам их сжимают в общий низкоранговый латент c (down-projection), кэшируют только c, а при счёте внимания разворачивают обратно (up-projection):

c = Wdown h  (кэшируем),   K, V = Wup c  (восстанавливаем)

KV-кэш становится кратно меньше → дешевле длинный контекст (ср. PagedAttention #49, но здесь экономия в самой архитектуре).

RLVR — RL on Verifiable Rewards. Награда — это проверяемая правильность финального ответа (математика, код, где результат можно проверить), а не оценка reward-модели:

r(ответ) = 1, если ответ верен (проверяемо); иначе 0

R1-Zero обучали ЧИСТЫМ RL от базовой модели, без SFT — и поведения рассуждения (самопроверка, переосмысление, удлинение цепочки) ВОЗНИКЛИ сами, включая знаменитый «aha moment». Это эхо AlphaGo (#29): улучшение через взаимодействие + проверку, только «поиск» развернулся в цепочку мысли.

Python RLVR — награда за проверяемую правильность
# никакой reward-модели: награда = верен ли ответ (проверяемо)
def reward(answer, question):
    return 1.0 if verify(answer, question.gold) else 0.0   # математика/код
# R1-Zero: чистый RL от базовой модели, без SFT
# → рассуждение (самопроверка, длинные цепочки) возникает само
база (MoE+MLA)V3 чистый RL (RLVR)проверяемые награды рассуждениеR1 («aha») рассуждение выросло из RL, а не из разметки
Сильная open-база (V3) + чистый RL на проверяемых наградах (R1) → способность к рассуждению возникает сама, без SFT-демонстраций.
Аналогия. Не натаскивать ученика на образцовых решениях (SFT), а просто давать задачи с проверяемым ответом и награждать за правильность. Чтобы чаще попадать, ученик САМ начинает выписывать ход решения, перепроверять себя, возвращаться к ошибкам — стратегия рассуждения рождается из стремления к верному ответу, а не копируется с примеров. Тот же дух, что self-play в AlphaGo.

Почему это важно

Приблизил открытые модели к фронтиру; R1 — публичный рецепт reasoning через RL (прямое развитие Chain-of-Thought #43 + идеи «обучение+поиск» из AlphaGo). Нюанс (флаг): заявленная стоимость финального прогона V3 (~2.788M H800-часов ≈ $5.6M) ОСПАРИВАЕТСЯ — она не включает прежние исследования, провальные прогоны, данные и capex; это стоимость финального прогона, не «всё-в-итоге».

Связи

← масштабирует31. Mixture-of-Experts

V3 — это sparse-MoE «Outrageously Large» 2017-го, доведённый до фронтира: 671B общих, ~37B активных, плюс улучшения роутинга (балансировка без auxiliary loss). Прямая линия от идеи условных вычислений к открытой модели уровня GPT-4.

→ развивает43. Chain-of-Thought

CoT (2022) показал, что рассуждение по шагам резко поднимает качество — но через промпт. R1 делает следующий шаг: обучает модель рассуждать через RL, и длинные цепочки мысли возникают сами. Промптинг превратился в выучиваемую способность.

↔ перекликается29. AlphaGo

Та же философия «улучшение через взаимодействие + проверка»: AlphaGo — self-play + поиск по дереву, R1 — RL + проверяемые награды, где «поиск» развёрнут в цепочку рассуждения. Спустя 9 лет идея вернулась из го в язык.

Вопросы пытливого ума

Почему рассуждение «возникает само» из чистого RL — это не запрограммировано?

Нет, не запрограммировано — это эмерджентно. Модель просто награждают за верный ответ; чтобы чаще попадать на трудных задачах, ей выгодно тратить больше «мысли» — выписывать шаги, проверять себя, перебирать. RL находит эту стратегию сам, без явных инструкций. Поразительно, что самопроверка и удлинение рассуждения возникают как инструментальная цель максимизации награды.

Почему RLVR работает там, где обычный RLHF буксует?

Потому что награда объективна и проверяема (ответ верен или нет), а не оценка несовершенной reward-модели. Нет reward hacking в обычном смысле — нельзя «обмануть» проверку правильности. Ограничение: RLVR применим лишь там, где результат проверяем (математика, код, логика); на «мягких» задачах (стиль, полезность) по-прежнему нужны человеческие/AI-предпочтения.

Стоила ли DeepSeek правда ~$6M — и почему это вызвало обвал рынка?

Цифра ~$5.6M — это стоимость финального прогона по арендным ставкам, без учёта прежних исследований, провальных запусков, данных и капитальных затрат на кластер. Полная стоимость кратно выше. Но сам факт, что открытая модель уровня фронтира обучена дёшево, в январе 2025 обвалил акции (Nvidia −~17% за день, рекордная потеря капитализации) — рынок испугался, что монополия дорогих закрытых лабораторий и спрос на GPU под угрозой. Урок: и инженерная цифра, и её интерпретация важны — здесь интерпретация была раздута.

Что читать в оригинале

V3 — выжимка (MLA, MoE-инженерия); R1 — ключевое (схема pure-RL reasoning, RLVR и описание «aha moment»). Это финал канона — и хорошая точка, с которой начинается фронтир сегодняшнего дня.