Зрение: документы, OCR, видео и генерация медиа

Урок 5 из 7 курса «Qwen на практике»: неофициальный курс AI University о Qwen. Урок входит в платный доступ; первые уроки курса бесплатно.

О чём урок

Пятый урок посвящён зрению: как через API Qwen читать документы, разбирать счета и накладные в структурированный JSON, задавать вопросы по видео и генерировать изображения и ролики. После урока вы сможете отправить в API сканированный документ и получить аккуратный JSON с нужными полями, загрузить видео длиной до двух часов и получить ответ по его содержанию, а также понять, какие модели и кукбуки использовать для своих задач с картинками, PDF и видео.

Неофициальный курс AI University. Тексты, примеры и задания написаны нашей командой по открытой документации Qwen, QwenCloud и Alibaba Cloud Model Studio и опыту разработчиков на 04.10.2026; курс не связан с компанией Alibaba Cloud и не одобрен ею. Модели и цены меняются, сверяйтесь с документацией.

Материал рассчитан на тех, кто уже прошёл урок 3 (ключ, базовые запросы) и урок 4 (размышления, инструменты, JSON): код здесь строится поверх той же библиотеки openai и того же DASHSCOPE_API_KEY.

Зрение в 2026 году встроено прямо в основные языковые модели: отдельной линии «VL» для новых версий больше нет, картинки и видео понимают qwen3.8-max, qwen3.8-flash, qwen3.7-plus, qwen3.7-flash, модели серий 3.6 и 3.5. Официальная рекомендация для зрения та же, что и для текста: начинать с флагмана qwen3.8-max, когда нужна максимальная точность распознавания и рассуждения по изображению, а затем переходить на qwen3.7-plus или qwen3.8-flash, если задача простая и важна цена.

Картинку можно передать двумя способами: прямой ссылкой (image_url) или в формате base64, встроенным прямо в тело запроса как data:image/jpeg;base64,.... Второй способ нужен, когда файл лежит у вас локально и его не хочется выкладывать в открытый доступ.

В документации для qwen3.8-max указано, что один запрос может содержать до 2048 картинок, если они переданы по URL, и до 250, если в base64, а максимальный размер одной картинки на входе 16 мегапикселей.

Токены картинки…

План урока

  1. Картинки в API: base64, URL и как считаются токены
  2. qwen-vl-ocr: извлечение данных из документов
  3. Многостраничные документы, PDF и очень длинные тексты
  4. Кукбуки Qwen3-VL: готовые рецепты с открытым кодом
  5. Генерация изображений и видео через API
  6. Попробуйте сами
  7. Итоги
  8. Официальные материалы Qwen

Урок входит в полный доступ. Полный текст и видео открываются после оплаты. Первые уроки каждого курса бесплатны.

Полезные гиды