Переводим книгу из общественного достояния

Урок 35 из 80 курса «Gemini API: примеры использования»: официальный курс Gemini API Cookbook (Гугл Джемини) на русском языке. Урок входит в платный доступ; первые уроки курса бесплатно.

О чём урок

В этом notebook вы изучите модель Gemini как инструмент для перевода, демонстрируя, как подготовить данные, создать эффективные prompt'ы и сохранить результаты в файл .txt. Этот подход значительно улучшает доступность знаний. Различные источники предоставляют книги с открытым исходным кодом. В этом notebook вы будете использовать Project Gutenberg в качестве ресурса. Эта платформа предоставляет доступ к широкому спектру книг, доступных для бесплатной загрузки в форматах PDF, eBook, TXT и других. Чтобы запустить следующую cell, ваш API key должен быть сохранен в Colab Secret с именем GEMINI_API_KEY. Если у вас еще нет API key или вы не знаете, как создать Colab Secret, см. Authentication для примера. Вы переведете известную книгу Артура Конан Дойла о детективе Шерлоке Холмсе с польского языка (пер. Евгении Жмиевской) на английский. Вот названия на польском и английском: Название на польском: Tajemnica Baskerville'ów: dziwne przygody Sherlocka Holmes Название на английском: The Hound of the Baskervilles Книги содержат всевозможные вымышленные или исторические описания, некоторые из них довольно буквальны и могут привести к тому, что модель прекратит выполнение запроса на перевод. Чтобы предотвратить некоторые из этих исключений, пользователи могут изменить safety_setting со значения по умолчанию на более открытый подход. Приступим к инициализации модели Gemini Flash для этой задачи. Начните с подсчета количества token'ов в книге, чтобы понять, нужно ли переходить к следующему шагу (разделение текста на более мелкие chunk'и). LLM ограничены лимитами token'ов. Чтобы оставаться в пределах лимита Gemini Flash, важно обеспечить следующее: Лимит входных token'ов не должен превышать: 1 048 576 token'ов Лимит выходных token'ов не должен превышать: 8 192 token'а Поскольку входные chunk'и переведенного текста будут служить output'ами, рекомендуется разделять их на более мелкие сегменты. Как вы увидите в примере, существует более 1000 небольших chunk'ов. Вызов API для подсчета token'ов каждого из них занял бы много времени.

План урока

  1. Настройка вашего API key
  2. Подготовка данных
  3. Информация о token'ах
  4. Разделение текста на chunk'и
  5. Группировка мелких chunk'ов
  6. Перевод
  7. Prompt
  8. Перевод chunk'ов

Урок входит в полный доступ. Полный текст и видео открываются после оплаты. Первые уроки каждого курса бесплатны.

Урок входит в темы

Полезные гиды