Массовое распознавание документов через Batch API

Урок 64 из 148 курса «Mistral AI Cookbook»: официальный курс Mistral AI Cookbook (Мистраль) на русском языке. Урок входит в платный доступ; первые уроки курса бесплатно.

О чём урок

Оптическое распознавание символов (OCR) позволяет извлекать текстовые данные из изображений. С помощью Mistral OCR вы можете делать это чрезвычайно быстро и эффективно, извлекая текст из сотен и тысяч изображений (или PDF-файлов). В этом простом руководстве мы извлечем текст из набора изображений, используя два метода: Без Batch Inference: Перебор набора данных, извлечение текста из каждого изображения и сохранение результата. С Batch Inference: Использование Batch Inference для извлечения текста со снижением стоимости на 50%. OCR Batch Inference Сначала установим mistralai и datasets Теперь мы можем настроить наш клиент. Вы можете создать API key на AI Studio. В качестве примера используем Mistral OCR для извлечения текста из нескольких изображений. Мы будем использовать набор данных, содержащий необработанные данные изображений. Чтобы отправить эти данные по URL изображения, нам нужно закодировать их в base64. Для получения дополнительной информации посетите нашу документацию по Vision. Для этой демонстрации мы будем использовать простой набор данных, содержащий многочисленные документы и сканы в формате изображений. В частности, мы будем использовать набор данных HuggingFaceM4/DocumentVQA, загруженный с помощью библиотеки datasets. Для этой демонстрации мы загрузим только 100 образцов. Когда наш поднабор из 100 образцов будет готов, мы можем перебрать каждое изображение для извлечения текста. Мы сохраним результаты в новом наборе данных и экспортируем его как файл JSONL. Отлично, мы извлекли весь текст из 100 образцов. Однако этот процесс можно сделать более экономичным с помощью Batch Inference. Чтобы использовать Batch Inference, нам нужно создать файл JSONL, содержащий все данные изображений и информацию о запросах для нашего batch. Давайте создадим функцию create_batch_file для выполнения этой задачи, генерируя файл в правильном формате. Следующий шаг включает кодирование данных каждого изображения в base64 и сохранение URL каждого изображения, которое будет использоваться. Теперь мы можем создать наш batch-файл. Когда всё готово, мы можем загрузить его в API. Файл загружен, но Batch Inference ещё не запущен.

План урока

  1. Применение OCR для преобразования изображений в текст
  2. Использовано
  3. Настройка
  4. Без Batch
  5. С Batch

Урок входит в полный доступ. Полный текст и видео открываются после оплаты. Первые уроки каждого курса бесплатны.

Полезные гиды