Цели урока
- Как реализовать надёжный пайплайн для суммаризации документов любой длины.
- Основополагающий паттерн «Map-Reduce» для обработки документов.
- Техники «semantic chunking» для логического разделения документа с сохранением контекста.
- Как создавать эффективные, специфичные для каждого этапа prompts для многоступенчатого LLM пайплайна.
- Как связывать LLM calls для выполнения сложных, многоэтапных задач.
О чём урок
Copyright (c) Meta Platforms, Inc. и аффилированные лица. Это программное обеспечение может использоваться и распространяться в соответствии с условиями Лицензионного соглашения сообщества Llama. Этот туториал покажет вам, как создать надёжный пайплайн суммаризации для длинных документов. Мы разработаем «Интеллектуального помощника по суммаризации», который использует Llama 4 для обобщения документа, слишком длинного для обработки за один проход. Хотя модели, такие как Llama 4, обладают огромными context windows, суммаризация чрезвычайно длинных текстов иногда может приводить к тому, что детали «теряются в середине». Чтобы решить эту проблему, мы реализуем паттерн Map-Reduce: сначала мы «map» задачу суммаризации на меньшие, связные chunks текста, а затем «reduce» эти отдельные summaries в окончательный, высокоточный обзор. Компонент Выбор Почему Модель Llama-4-Maverick-17B-128E-Instruct-FP8 Мощная модель, идеально подходящая для высококачественной суммаризации как на этапе chunk, так и на этапе финального summary. Паттерн Map-Reduce Summarization Фундаментальный паттерн для обработки длинных документов. Мы «map» функцию суммаризации на каждый chunk, затем «reduce» полученные summaries в итоговый. Инфраструктура Llama API Предоставляет доступ к моделям Llama 4 с использованием SDK llama_api_client. Примечание об Inference Providers: Этот туториал использует Llama API для демонстрационных целей. Однако вы можете запускать модели Llama 4 с любым предпочтительным inference provider. Распространённые примеры включают Amazon Bedrock и Together AI. Основная логика этого туториала может быть адаптирована для любого из этих провайдеров. Для этого проекта вам понадобятся две библиотеки: tiktoken для точного подсчёта токенов и официальный llama-api-client. Импортируйте необходимые модули и инициализируйте LlamaAPIClient. Для этого требуется, чтобы Llama API key был доступен в качестве переменной окружения. Если у вас нет Llama API key, пожалуйста, получите его на Meta Llama API. Помните, что для этого туториала мы используем Llama API, но вы можете адаптировать этот раздел для использования вашего предпочтительного inference provider.
План урока
- Что вы узнаете
- Установка зависимостей
- Импорты и настройка Llama API client
- Шаг 1: Получение данных
- Шаг 2: Логика chunking
- Зачем Chunk?
- Как chunk?
- Выбор правильного Chunk Size
Урок входит в полный доступ. Полный текст и видео открываются после оплаты. Первые уроки каждого курса бесплатны.