Промпт, то есть текстовое описание того, что должно происходить в ролике, определяет результат куда сильнее, чем выбор сервиса. Во многом одна и та же формула работает и в Kling, и в Wan, и в справке Google по видео: крупные разработчики видеомоделей советуют одинаковую структуру текста, хотя причины этого совпадения в официальных материалах не раскрываются. В этом уроке вы разберёте рабочую формулу промпта, язык камеры, правила для реплик и раскадровки, а также узнаете, чего от видеомоделей пока ждать не стоит. После урока вы сможете составить промпт так, чтобы не тратить бесплатные кредиты на переделки.
Неофициальный курс AI University. Тексты, промпты и задания написаны нашей командой по официальным страницам тарифов, справке и условиям сервисов на 04.10.2026; курс не связан с компаниями-разработчиками Kling, Wan, Qwen, ZSky и Pika и не одобрен ими. Бесплатные лимиты меняются часто, сверяйтесь со страницами тарифов.
Зачем вообще формула, а не свободный текст
Бесплатных кредитов на любом сервисе немного, а каждая неудачная генерация съедает часть дневного или месячного лимита. Беспорядочное описание в духе «красивое видео с котом в городе, драматично» модель интерпретирует как ей вздумается: субъект, движение и стиль смешиваются, и результат получается случайным. Официальные гайды Kling и Wan советуют разбивать запрос на отдельные смысловые блоки: кто или что в кадре, что оно делает, где происходит действие, как снимает камера, какой свет и в каком стиле. Google в справке «Create videos in Google Flow» даёт похожий совет: «будьте конкретны в отношении субъекта, действия, окружения, освещения и стиля». У разных компаний эта рекомендация совпадает почти дословно, и для вас это значит одно: чем чётче разложен промпт на части, тем предсказуемее итог.
Второе правило касается количества действий. Официальный блог Kling об ограничениях моделей прямо связывает нестабильность кадра со смешением нескольких действий в одном плане: предметы исчезают, свет «плывёт», фон начинает дрейфовать. Правило простое: один главный экшен на один план. Если хочется показать «персонаж встаёт, подходит к окну, открывает штору и смотрит на улицу», лучше разбить это на несколько отдельных планов или коротких роликов, а не пытаться уместить всё в одной генерации на 5-10 секунд.
Формула: объект, действие, сцена, камера, свет, стиль
В официальном гайде Kling по тексту в видео формула выглядит так: субъект (с описанием) плюс движение субъекта плюс сцена (с описанием) плюс, по желанию, язык камеры, свет и атмосфера. У Wan базовая формула короче: субъект плюс сцена плюс движение, а продвинутая версия добавляет эстетику (источник света, крупность плана, ракурс, объектив, движение камеры) и стилизацию, например «киберпанк» или «линейная иллюстрация». Для курса удобно свести это к одной универсальной схеме из шести блоков:
Subject: кто или что в кадре, внешность, одежда, поза
Subject Movement: что это существо или предмет делает, коротко и выполнимо за 5-10 секунд
Scene: место действия, фон, детали окружения
Camera: крупность плана, ракурс, движение камеры
Lighting: источник и характер света
Style: общая стилистика и цветокоррекция
Официальный пример из гайда Kling показывает, как промпт растёт пошагово: сначала «гигантская панда читает книгу в кафе», затем добавляются очки, чашка кофе, окно, и в конце дописывается «средний план, размытый фон, рассеянный свет, кинематографичная цветокоррекция». Каждый шаг добавляет один новый слой, а не переписывает всё заново. Такой метод полезен и в вашей работе: сначала фиксируете субъект и общий вид, потом добавляете движение, и только в последнюю очередь уточняете камеру и свет мелкими правками, а не одним большим изменением.
Важная деталь из того же гайда: модели «не чувствительны к числам». Если в промпте написать «десять щенков бегут по лужайке», не удивляйтесь, что в кадре окажется три или пять. Если нужен точный счёт объектов, надёжнее закладывать его в саму картинку для режима image-to-video, а результат текстовой генерации просто проверять и при необходимости перегенерировать план отдельно.
Текст в видео и картинка в видео: два разных сценария
Если вы генерируете ролик с нуля по тексту (режим text-to-video), описываете всё: кто в кадре, что он делает, где это происходит, как светит и снимает камера. Но если вы загружаете готовую картинку и просите оживить её (image-to-video), правила меняются. Официальный гайд Kling формулирует это так: промпт равен субъекту и движению плюс фону и его движению, и описывать нужно только то, что должно измениться, а не то, что уже видно на изображении. В гайде приводится показательный пример: фраза «Put on sunglasses» (наденьте солнечные очки) модель не поняла, а «Mona Lisa puts on sunglasses with her hand» (Мона Лиза надевает солнечные очки рукой) сработала, потому что явно назвала субъект и способ действия.
У Wan для image-to-video формула ещё короче: движение плюс движение камеры, поскольку субъект, сцена и стиль уже заданы картинкой. Скорость действия регулируется наречиями, например «медленно» или «быстро», а если камера должна оставаться неподвижной, в промпт добавляется явное указание на фиксированную камеру, в оригинальном китайском гайде это устойчивая фраза «固定镜头».
Частая ошибка новичков: при оживлении фото они заново описывают цвет упаковки, фон и свет, которые и так видны модели на самой картинке. Это не ошибка в строгом смысле, но лишние слова отвлекают модель от главного, движения, и могут спровоцировать смену плана, если описание расходится с тем, что реально изображено. Официальный гайд Kling предупреждает: если текст сильно отличается от содержимого картинки, модель может решить, что нужен монтажный переход, а не плавное движение.
Язык камеры: крупность, ракурс, движение
Операторская терминология в промпте работает лучше, чем бытовые описания вроде «снять красиво». Официальный гайд Kling различает два слоя: «camera language» (ракурс и крупность плана как часть описания кадра) и «camera movement» (отдельный управляемый параметр движения камеры).
Крупность плана и ракурс, которые перечислены в официальном гайде Kling или встречаются в его примерах:
- close-up, крупный план
- medium shot, средний план
- ultra-wide, сверхширокий план
- aerial, съёмка с воздуха
- low angle, нижний ракурс, камера смотрит вверх
- high angle, верхний ракурс, камера смотрит вниз
- telephoto, съёмка длиннофокусным объективом, зрительно сжимает пространство
- bokeh, размытый фон за счёт малой глубины резкости
- depth of field, глубина резкости как отдельный параметр кадра
Движения камеры, перечисленные в документации Kling: Horizontal (сдвиг по горизонтали), Vertical (сдвиг по вертикали), Zoom (наезд и отъезд), Pan (панорама, поворот камеры по горизонтали), Roll (вращение вокруг оптической оси), Tilt (наклон камеры вверх-вниз). Отдельно есть готовые сочетания, Master Shots, например «Move Left and Zoom In»: удобно, если нужно одновременное движение и приближение, похожее на облёт объекта, без ручной сборки нескольких параметров.
Свет тоже описывается отдельным словарём, который приводит гайд Kling: ambient (рассеянный, ровный свет), morning light (утренний свет), sunset (закатный свет), Tyndall effect (лучи света, видимые в дымке или пыли, часто используется для «воздуха» в кадре), artificial (искусственное освещение, студийное или уличное).
Фиксированная камера заслуживает отдельного упоминания. Если вы хотите, чтобы камера вообще не двигалась, это стоит прописать явно: в китайском гайде Wan для этого есть устойчивая фраза «固定镜头». Без такого уточнения модель может сама добавить лёгкое панорамирование, которое не всегда уместно, особенно для товарных роликов на статичном фоне.
Звук и реплики, если модель умеет озвучку
Не все модели генерируют звук и голос внутри ролика. Kling VIDEO 3.0 с включённым Native Audio умеет произносить реплики персонажей на пяти языках: китайском, английском, японском, корейском и испанском, с акцентами. Формат реплики в промпте такой:
Woman (confident tone): "Our new plan starts at ten dollars a month."
Если написать реплику на другом языке, модель, по данным официального гайда, переведёт её на английский. Русского языка в списке поддерживаемых нет, поэтому для роликов с голосом надёжнее сразу писать текст реплики по-английски и указывать тон в скобках: спокойный, уверенный, взволнованный и так далее.
У Wan звуковой блок устроен подробнее и состоит из трёх типов описаний. Голос: текст реплики в кавычках, который сохраняется дословно, плюс эмоция, интонация, темп, тембр и акцент. Звуковой эффект: материал источника звука, действие и окружение, например шум дождя по асфальту и далёкий гул машин. Музыка: описание в духе «фоновая музыка плюс стиль». Если реплика не нужна, в промпт добавляется явный запрет «No dialogue.», потому что без него модель может придумать свою фразу, а если не нужна музыка, то «No background music.». Эти формулировки в материалах описаны именно как запретительные фразы для звука, а не как общий «негативный промпт».
Про негативные промпты в широком смысле, то есть список того, чего не должно быть в кадре (лишние предметы, искажения, определённые цвета), стоит сказать прямо: в прочитанных официальных гайдах Kling VIDEO 3.0, Kling 4.0 и в документации Wan3.0 такого отдельного поля или синтаксиса не описано. Если раньше в интерфейсах такое поле и встречалось, подтверждения, что оно действует сейчас, в официальных материалах нет. Поэтому не стоит рассчитывать на фразы вроде «no low quality, no watermark» как на надёжный инструмент: безопаснее описывать то, что вы хотите видеть, а нежелательные детали просто не упоминать.
Раскадровка: несколько планов в одном запросе
Когда нужен ролик из нескольких кадров, например витрина товара с трёх ракурсов или мини-история с завязкой и развязкой, у Kling и Wan есть свой синтаксис раскадровки, и в обоих случаях он построен вокруг явной нумерации планов.
В Kling VIDEO 3.0 режим Multi-Shot включается отдельным переключателем в интерфейсе: без него модель всегда делает один план, даже если в тексте написано «Shot 1, Shot 2». Формат такой:
Shot 1, profile shot of a woman walking into a café, cinematic handheld.
Shot 2, close-up of her hands wrapping around a warm cup.
Если, наоборот, нужен один длинный непрерывный план без склеек, официальный гайд рекомендует прямо добавить фразу «one continuous long take without any cuts».
У Wan раскадровка строится через общее описание, номер плана и таймкод. В официальном китайском гайде пример выглядит как «镜头 1[0-3 秒]..., 镜头 2[3-6 秒]...»; ниже приведён переведённый эквивалент этой же схемы, пригодный для описания логики, а не как точная официальная англоязычная запись:
Overall: a product launch teaser for a smartwatch
Shot 1 [0-3s]: close-up of the watch face lighting up on a dark table
Shot 2 [3-6s]: hand picks up the watch and turns it toward the camera
Для одного плана без деления в том же гайде советуют явно написать «生成单镜头», по-английски «Generate single shot.», чтобы модель не начала самостоятельно нарезать ролик на куски.
Раскадровка особенно полезна для коротких рекламных роликов и сторис: вместо того чтобы одним промптом пытаться показать «общий план кофейни, затем крупный план чашки, затем лицо бариста», стоит разложить это на отдельные планы с собственной крупностью и движением камеры в каждом.
Чего видеомодели пока не умеют
Несколько ограничений стоит знать заранее, чтобы не тратить кредиты на заведомо нереалистичные запросы. Официальный гайд Kling прямо говорит, что модель «не чувствительна к числам»: просить точное количество предметов в кадре, например десять щенков или пять монет, бессмысленно, итог будет случайным. Сложная физика тоже пока плохо поддаётся: отскок мяча по точной траектории, брошенный предмет, который должен приземлиться в конкретную точку, поведение ткани, воды или длинных волос часто выглядят неестественно. Официальный блог Kling об ограничениях моделей советует дробить такие действия на более мелкие шаги и описывать движение субъекта отдельно от движения камеры, а не пытаться описать всё одной длинной фразой.
Текст и мелкие детали в кадре остаются слабым местом: пальцы часто деформируются, надписи получаются с ошибками, логотипы «плывут» и меняют форму от кадра к кадру. Официальная рекомендация простая: текст, субтитры и финальный логотип лучше добавлять при монтаже после генерации, а не просить модель нарисовать их внутри видео. По наблюдениям обзоров, которые тестировали китайскую версию Kling 3.0, похожая проблема проявляется при быстром движении: резкие рывки камеры или персонажа чаще дают смаз и артефакты текста, чем спокойные сцены, так что для статичных товарных съёмок стоит выбирать плавное, предсказуемое движение. Это наблюдение стоит воспринимать как мнение, а не как гарантированную закономерность.
Консистентность между соседними планами тоже не гарантирована: лицо, причёска, одежда или форма продукта могут слегка меняться от плана к плану. Официальный совет: использовать одни и те же референсные изображения, например через функцию Elements, и не менять одновременно свет, ракурс и стиль, иначе модель воспримет это как сигнал полностью пересобрать сцену.
Десять готовых промптов для разных задач
Ниже примеры, которые можно адаптировать под свой продукт или сервис. Каждый построен по формуле из раздела выше; в части с репликами и раскадровкой используется синтаксис, описанный в гайдах Kling VIDEO 3.0 и Wan.
Товар на столе, один плавный разворот без лишних действий:
Subject: a matte black wireless speaker with rounded edges, logo facing camera
Subject Movement: speaker slowly rotates 180 degrees on a reflective table
Scene: minimalist studio, soft grey backdrop
Camera: close-up, shallow depth of field
Lighting: soft studio lighting from top left
Сцена в кофейне с одним главным действием:
Subject: a barista in a green apron, calm expression
Subject Movement: pours latte art into a white cup, steam rising
Scene: cozy café interior, wooden counter, blurred customers in background
Camera: medium shot, bokeh background
Lighting: warm morning light through a window
Пейзаж для заставки с движением камеры и атмосферой:
Subject: snow-capped mountain range at dawn
Subject Movement: clouds drift slowly across the peaks
Camera: slow aerial pan from left to right
Lighting: golden sunrise light, Tyndall effect through morning mist
Style: cinematic color grading
Говорящий персонаж с репликой, формат «персонаж, тон, реплика»:
Subject: a young woman in a blue blazer, standing in a modern office
Subject Movement: she looks into the camera and gestures with her hand
Camera: medium close-up, fixed camera
Woman (confident tone): "Our new plan starts at ten dollars a month."
Оживление фото продукта, только движение и камера, без описания фона и товара:
Movement: the ceramic mug slowly rotates clockwise, steam rises gently from the coffee
Camera: slow zoom in, fixed horizontal position
Сторис для салона красоты, вертикальный короткий план:
Subject: a hairstylist combing long wavy hair of a seated client
Subject Movement: gentle brushing motion, hair catches the light
Scene: bright salon interior, mirrors in background
Camera: close-up, shallow depth of field
Lighting: soft artificial light
Анимация логотипа без текста, буквы добавляются позже на монтаже:
Subject: a minimalist geometric logo made of thin gold lines forming a circle
Subject Movement: lines slowly draw themselves and connect into a full circle, then gently pulse
Scene: plain dark background
Lighting: soft glow around the lines
Раскадровка из трёх планов для рекламы кроссовок, формат Kling Multi-Shot:
Shot 1, wide shot of a running shoe on a starting line, cinematic lighting.
Shot 2, close-up of the shoe sole flexing as the runner pushes off.
Shot 3, tracking shot following the runner down the track, motion blur in background.
Раскадровка по таймкодам для тизера, переведённый аналог формата Wan:
Overall: a product launch teaser for a smartwatch
Shot 1 [0-3s]: close-up of the watch face lighting up on a dark table
Shot 2 [3-6s]: hand picks up the watch and turns it toward the camera
Ролик без музыки и реплик, только звуки среды:
Subject: rain falling on a quiet city street at night
Subject Movement: raindrops hit puddles, neon reflections ripple
Sound effect: rain hitting pavement, distant traffic hum
No dialogue.
No background music.
Эти примеры стоит сохранить как заготовки и менять только субъект, сцену и реплику под свою задачу, не трогая саму структуру.
Попробуйте сами
- Возьмите слабый промпт «cat in city, cool video» и перепишите его по формуле: субъект, действие, сцена, камера, свет, стиль. Результат готов, когда в тексте явно выделены все шесть блоков и описано только одно главное действие кота, а не несколько сразу.
- Для одной и той же картинки товара составьте два промпта: первый для режима «текст в видео» с полным описанием субъекта, сцены и света, второй для режима «картинка в видео», где должно остаться только движение и камера. Проверьте результат: во втором варианте не должно быть повторного описания фона или внешнего вида, которые уже видны на фото.
- Напишите раскадровку из двух-трёх планов для короткого ролика о своём деле, например сторис о товаре или услуге, используя формат «Shot 1, ... Shot 2, ...» или таймкоды «[0-3s]». Готово, если в каждом плане указана крупность кадра и одно конкретное действие, а свет и стиль не противоречат друг другу между планами.
Итоги
- Формула «объект, действие, сцена, камера, свет, стиль» опирается на официальные рекомендации Kling, Wan и Google и помогает не тратить бесплатные кредиты на случайный результат.
- Один план, одно главное действие: смешение нескольких действий в одном коротком ролике чаще всего портит стабильность кадра.
- Для картинки в видео описывайте только движение субъекта и камеры, а не то, что уже видно на изображении, иначе модель может решить, что нужна смена плана.
- Реплики задаются форматом «персонаж (тон): текст»; Kling поддерживает пять языков без русского, поэтому для озвучки надёжнее писать текст по-английски.
- Раскадровка через «Shot 1, Shot 2» или таймкоды экономит кредиты: лучше заранее разбить ролик на планы, чем переснимать длинный клип целиком.
- Не просите точное число предметов, сложную физику и текст внутри кадра: эти элементы пока нестабильны, надписи и логотипы безопаснее добавлять при монтаже, а отдельного поля для негативного промпта в актуальных гайдах не описано.