Изображения и файлы: Vision и Files API

Урок 8 из 12 курса «DeepSeek на практике»: неофициальный курс AI University о DeepSeek. Урок входит в платный доступ; первые уроки курса бесплатно.

О чём урок

Восьмой урок посвящён работе с изображениями и файлами в DeepSeek API. Разберёмся, какая модель умеет «смотреть» на картинки, как устроена оплата таких запросов и какими тремя способами можно передать изображение в запрос. Отдельно рассмотрим Files API: сервис для хранения файлов, который экономит трафик и деньги, когда одна и та же картинка нужна в нескольких запросах. В конце соберём всё в практическую задачу: извлечение данных из фото документа в структурированный JSON.

Неофициальный курс AI University. Тексты, примеры и задания написаны нашей командой по открытой документации DeepSeek на 03.10.2026; курс не связан с DeepSeek и не одобрен ею. Модели и цены меняются, сверяйтесь с документацией.

После урока вы сможете подключить к своим скриптам распознавание чеков, накладных, скриншотов интерфейсов и фотографий товаров, выбрать подходящий способ передачи изображения под конкретную задачу и оценить, во сколько обойдётся обработка партии картинок.

Из двух моделей API изображения понимает только deepseek-flash. Модель deepseek-v4-pro работает исключительно с текстом: отправлять ей картинки не имеет смысла, а точное поведение API при такой ошибочной попытке лучше проверить на сайте документации. На практике это означает, что в проекте, где v4-pro используется ради качества рассуждений на тексте, для задач с изображениями придётся отдельно обращаться к flash.

Старое имя deepseek-v4-flash-vision-exp по прежнему принимается API, но модель с таким именем уже снята с обслуживания, и все такие запросы автоматически обрабатывает актуальная flash-модель. Писать стоит сразу deepseek-flash.

Поддерживаемые форматы изображений: JPEG, PNG, GIF и WebP. Формат определяется по содержимому файла, а не по расширению или заявленному MIME-типу, так что переименованный файл не обманет модель, но и не помешает её работе.

Цена запроса с картинкой складывается так же, как и для текстовых запросов: вход и выход считаются в токенах по тарифам deepseek-flash.

Перед тем как модель начнёт анализировать изображение, оно автоматически приводится к определённому размеру.

Если в запросе несколько изображений, каждое считается по этому правилу независимо…

План урока

  1. Какая модель видит изображения
  2. Как изображения превращаются в токены
  3. Три способа передать картинку
  4. Files API: загружаем один раз, используем много раз
  5. Практические задачи с Vision
  6. Ограничения и проверка результата
  7. Попробуйте сами
  8. Итоги

Урок входит в полный доступ. Полный текст и видео открываются после оплаты. Первые уроки каждого курса бесплатны.

Полезные гиды