Управляемость: насколько модель слушается

Урок 10 из 14 курса «Возможности и ограничения AI»: официальный курс Anthropic Academy (Антропик) на русском языке. Урок входит в платный доступ; первые уроки курса бесплатно.

О чём урок

В мире больших языковых моделей (LLM), таких как Claude, способность модели следовать вашим указаниям является одной из ключевых характеристик. Мы называем это управляемостью (Steerability). Это свойство позволяет вам задавать модели роль, тон, формат или ограничение по длине ответа, и она, как правило, успешно их применяет, часто с первой попытки. Важно понимать, что эта способность не возникла сама по себе. Она является результатом дообучения (fine-tuning) — второго этапа тренировки, в ходе которого модель обучается на тщательно отобранных примерах хорошего поведения ассистента. В процессе этого обучения модель усваивает привычку воспринимать ваш текст как запрос и следовать установленным вами правилам. Однако управляемость не равносильна пониманию. Модель выполняет инструкции, используя тот же механизм завершения шаблонов (Next Token Prediction), который она применяет для всего остального. Это означает, что всегда существует определенный разрыв между словами, которые вы напечатали, и истинным намерением, которое вы имели в виду. Например, если вы попросите "ответить менее чем 100 словами, энергично", вы можете получить именно это — но при этом модель может упустить важную, но менее "энергичную" деталь, которая была критически важна для вашего запроса. Инструкция была выполнена буквально, но ваше истинное намерение осталось неучтенным. Представьте свои инструкции как точки на континууме. На одном конце — зона, где контроль над моделью наиболее точен и предсказуем, а на другом — где он становится более размытым и непредсказуемым. В этой зоне находятся короткие, конкретные и легко проверяемые инструкции. Примеры включают: "ответьте в виде таблицы", "менее 100 слов", "используйте эту точную схему JSON" или "ответьте от лица историка". Здесь шаблон для сопоставления прост, и вы можете мгновенно проверить, насколько точно модель ему следовала. Это область, где Claude демонстрирует высокую надежность в выполнении ваших указаний. По мере того как вы двигаетесь по спектру к более сложным задачам, контроль начинает ослабевать. Это происходит, когда инструкции включают: Длинные цепочки рассуждений: Задачи, требующие нескольких последовательных шагов логического вывода.

План урока

  1. Введение: Что такое Управляемость (Steerability)?
  2. Спектр Управляемости: От Точного Контроля до Размытых Задач
  3. Зона Высокой Управляемости (Capability Zone)
  4. Зона Ограниченной Управляемости (Limitation Zone)
  5. Типичные Сбои Управляемости
  6. Дрейф Рассуждений (Reasoning Drift)
  7. Буква вместо Духа (Letter over Spirit)
  8. Инъекция Промпта (Prompt Injection)

Урок входит в полный доступ. Полный текст и видео открываются после оплаты. Первые уроки каждого курса бесплатны.

Полезные гиды