Эпоха 5 · Эра LLM · 2022

45 Constitutional AI

Constitutional AI: Harmlessness from AI Feedback · Bai, Kadavath, Askell и др. · Anthropic
🟧 оригинал выборочно~1.5 чоригинал ↗
Суть за 20 секунд. Обучение безвредного ассистента через самокритику модели по набору письменных принципов («конституции») — RLAIF, заменяющий большинство человеческих меток вреда AI-фидбеком. Ассистент «безвреден, но не уклончив». Подход Anthropic к выравниванию.

Контекст

RLHF (#44) требует много человеческих меток «что вредно» — дорого, медленно, тяжело для разметчиков, плохо масштабируется. Бай и др. заменяют большинство этих меток обратной связью самой модели.

Идея и механизм

RLAIF на основе «конституции» — короткого списка письменных принципов. Две фазы: Supervised — модель генерирует ответ на провокационный запрос, затем сама КРИТИКУЕТ его по принципу и ПЕРЕПИСЫВАЕТ; дообучаем на правках. RL — модель сама сравнивает пары своих ответов по принципам, порождая preference-данные для reward-модели → RL (как RLHF, но без человеческих меток вреда).

обучение с подкреплением RLAIF: где человек, а где модель

Фаза 1 (SL): на вредный запрос модель даёт ответ y0, затем по принципу c из конституции критикует и переписывает:

y0 → critique(y0, c) → yrev,   дообучаем на (x, yrev)

Фаза 2 (RL): модель сама ранжирует пары своих ответов по принципам → получаем preference-данные без людей → обучаем reward-модель → RL (как в RLHF). Единственный человеческий вклад — текст принципов.

Сравните с RLHF: там пары размечают люди (P(yw ≻ yl) из человеческих оценок), здесь — модель по конституции. Это путь к масштабируемому надзору: человеческий труд = написать принципы, а не размечать миллионы примеров.

Python Цикл «критика → правка» (фаза 1)
principle = "Ответ не должен помогать причинять вред."

y0 = model(prompt)                                   # первый ответ
crit = model(f"{y0}\nКритика по принципу: {principle}")
y_rev = model(f"{y0}\nКритика: {crit}\nПерепиши лучше:")  # самоулучшение
finetune_on(prompt, y_rev)                            # учим на правках
ответ y₀ самокритика правка дообуч. принцип из конституции направляет критику
Модель сама критикует и улучшает свои ответы по письменным принципам — человек лишь задаёт принципы, а не размечает каждый пример.
Аналогия. Вместо того чтобы редактор вычитывал каждую статью журналиста, ему выдают редполитику (конституцию) и учат самого вычитывать свой текст по ней: «так, это нарушает пункт о вреде — перепишу». Редактор нужен один раз — чтобы написать политику; дальше журналист сам себя правит по ней в любом масштабе.

Почему это важно

Подход Anthropic к alignment; путь к масштабируемому надзору (модель помогает себя выравнивать) и явным, редактируемым ценностям (через текст конституции). Результат — ассистент «безвреден, но не уклончив»: вместо тупого отказа он объясняет, почему запрос проблемный.

Связи

← опирается на44. InstructGPT (RLHF)

Constitutional AI — это RLHF, где человеческие метки вреда заменены AI-фидбеком по конституции. Каркас тот же (предпочтения → reward-модель → RL), но источник предпочтений другой — сама модель, а не разметчики.

→ к идее53. DeepSeek V3 / R1

Общий мотив «модель улучшает себя через автоматическую обратную связь» развивается дальше: R1 учит рассуждать через RL на верифицируемых наградах (вместо AI-оценки принципов — проверяемая правильность). Разные сигналы, общая идея self-improvement без человека в петле.

↔ контраст51. DPO

Оба упрощают/удешевляют выравнивание относительно классического RLHF, но с разных сторон: CAI убирает человека из разметки предпочтений (AI-фидбек), DPO убирает RL из обучения (прямой classification-лосс). Их можно и совмещать.

Вопросы пытливого ума

Если модель сама себя оценивает, не закрепит ли она собственные ошибки?

Риск реален (model collapse / усиление смещений), и его сдерживают: конституция — внешний человеческий якорь, критика опирается на принципы, а не на «нравится/не нравится», и базовая модель уже достаточно способна судить о вреде. Но это активная область: насколько далеко можно зайти в самонадзоре без человеческого якоря — открытый вопрос масштабируемого надзора.

Кто пишет конституцию и почему это важно?

Принципы задают люди (в Anthropic — со ссылками на права человека и т.п.), и это делает ценности модели явными и редактируемыми: можно прочитать и изменить текст, а не гадать, что «зашито» в веса. Обратная сторона — ответственность за выбор принципов и их неизбежная неполнота/спорность. Прозрачность ценностей — и сила, и зона ответственности подхода.

«Безвреден, но не уклончив» — зачем так, почему не просто отказывать?

Модель, которая на всё подозрительное отвечает «не могу помочь», бесполезна и раздражает (over-refusal). CAI специально учит объяснять возражение, а не глухо отказывать — это и полезнее, и честнее. Тонкий баланс «безвредно, но не бесполезно» — осознанная цель дизайна, а не побочный эффект.

Что читать в оригинале

Читать ключевое — цикл «критика-правка» и схему RLAIF; примеры конституционных принципов дают интуицию.