Выбор подходящей модели
Вы выпускаете приложение с Claude. Какую модель выбрать? Если вы по умолчанию выберете самую умную, ваш счёт за API вас удивит. Выберите самую дешёвую, и результат может оказаться неудовлетворительным. Каждая модель имеет свои компромиссы, и правильный выбор влияет как на качество, так и на стоимость.
Уровни моделей
Anthropic в настоящее время предлагает четыре уровня моделей, и вы выбираете между ними с помощью параметра model в вашем вызове API.
- Claude Fable — это наша самая мощная модель на сегодняшний день, новый уровень, который превосходит Opus, созданный для ваших самых сложных задач. Она значительно дороже Opus, поэтому используйте её для работы, где эта дополнительная возможность оправдывает затраты. Текущая модель Fable — Claude Fable 5 (
claude-fable-5). - Claude Opus — самая мощная из трёх основных семейств моделей, но также и самая медленная и дорогая из них. Используйте её для глубокого анализа, сложного разбора, многоэтапного кодирования и тонкой работы с текстом. Текущая модель Opus — Claude Opus 5 (
claude-opus-5). - Claude Haiku — самая быстрая и экономичная модель, оптимизированная для скорости и эффективности затрат, а не для максимального интеллекта. Используйте её для больших объёмов работы низкой сложности, таких как классификация, извлечение данных и маршрутизация. Текущая модель Haiku — Claude Haiku 4.5 (
claude-haiku-4-5). - Claude Sonnet находится в золотой середине: сбалансированное сочетание интеллекта, скорости и стоимости, которое хорошо подходит для большинства производственных задач. Текущая модель Sonnet — Claude Sonnet 5 (
claude-sonnet-5).
Начните с простой оценки
Прежде чем писать production-код, настройте простую оценку (evaluation): набор примеров входных данных, которые вы прогоняете через каждую модель и оцениваете по тому, что означает хороший результат для вашего сценария использования. Вам не нужно ничего сложного — 20 или 30 репрезентативных примеров из вашей реальной рабочей нагрузки достаточно для начала.
Затем продвигайтесь по уровням:
- Сначала прогоните свои примеры через Haiku. Если качество устраивает, вы закончили — и только что сэкономили много денег.
- Если нет, перейдите к Sonnet.
- Используйте Opus только тогда, когда задача этого требует.
Сравнение уровней моделей
Давайте посмотрим на разницу между уровнями, а не просто поговорим о ней. Мы отправим один и тот же prompt через все три модели и понаблюдаем за latency и количеством токенов:
models = ["claude-haiku-4-5", "claude-sonnet-5", "claude-opus-5"] for model in models: response = client.messages.create( model=model, max_tokens=300, messages=[{"role": "user", "content": prompt}], ) print(model, response.usage)Здесь происходит две вещи:
- Цикл меняет поле
modelв каждом запросе. Один и тот же prompt, одно и то же максимальное количество токенов — меняется только модель. response.usageвозвращает вам входные и выходные токены напрямую из API, на основе которых рассчитывается ваш счёт.
Запустите его, и вы увидите три модели и три набора чисел. Opus занимает больше всего времени и выглядит наиболее отточенным — но для определения из двух предложений такая отточенность излишня. Sonnet немного сокращает текст. А Haiku возвращает ответ, часто менее чем за секунду, с очень компетентным двухпредложенческим ответом. Честно говоря, это идеально подходит для такого сценария.
И в этом вся суть: правильная модель — это самая дешёвая, результат которой вы действительно готовы выпустить. Для определения Haiku вполне достаточно. Для составления ответа на нормативный запрос вы бы провели то же сравнение и, вероятно, остановились бы на Opus. Оценка (eval) всегда имеет одинаковую форму.
Маршрутизация различных задач к разным моделям
В реальном приложении вы бы маршрутизировали различные виды работы к разным моделям внутри одной и той же конечной точки (endpoint). Возьмём, например, операционную панель с маршрутом обработки документов:
- Каждый входящий файл классифицируется с помощью Haiku.
- Обновления для клиентов составляются с помощью Sonnet.
- Только ответы на RFP требуют Opus.
Одна очередь, три модели, выбираемые для каждой задачи.
Краткое изложение
- Anthropic предлагает четыре уровня моделей: Fable для максимально доступных возможностей, Opus для сложных задач, Sonnet для повседневной работы и Haiku для больших объёмов.
- Настройте простую оценку (evaluation) — 20 или 30 репрезентативных примеров из вашей реальной рабочей нагрузки — прежде чем писать production-код.
- Проведите оценку (eval), начиная с Haiku и продвигаясь вверх, останавливаясь на самой дешёвой модели, результат которой вы действительно готовы выпустить.
response.usageсообщает количество входных и выходных токенов, на основе которых рассчитывается ваш счёт.- В production-среде маршрутизируйте различные задачи к разным моделям внутри одной и той же конечной точки (endpoint) вместо того, чтобы выбирать одну модель для всего.