← назад на главную
Карта процесса

Как на самом деле устроен контент-завод на ИИ-аватаре

Полная схема: что происходит на каждом шаге, какими сервисами, в каком порядке и какие нюансы ломают процесс, если их не знать заранее. Этого достаточно, чтобы собрать самому — или увидеть, где именно теряется время.

Верхний уровень

Тема → готовый ролик на площадках

Один вход, один выход. Всё, что между ними — четыре стадии и оркестратор, который их соединяет.

01
Сценарий
тема → текст + 3 хука
02
Кадры
картинки → анимация
03
Аватар
голос + лицо
04
Сборка
склейка → посты → выгрузка
Каждая стрелка — это n8n webhook. Каждая стадия может остановиться и подождать твоего подтверждения в Telegram, прежде чем идти дальше.
Не абстракция, а рабочий процесс

Как это выглядит внутри n8n

Схема выше — верхний уровень для понимания. Ниже — реальная цепочка узлов, как она собрана в n8n: каждый блок дёргает конкретный сервис и передаёт результат дальше.

Скриншот рабочей схемы n8n
Сюда — скриншот схемы из n8n.
Сохрани файл как n8n-схема.png рядом с этой страницей, и он подставится сам.
Разбор по шагам

Что происходит внутри каждой стадии

1

Сценарий

тема на входе → готовый текст с тремя вариантами хука на выходе
ТриггерСообщение в Telegram-бота или таблица с темами — n8n ловит новую строку/сообщение и запускает цепочку.
Генерация текстаLLM пишет сценарий под тайминг ролика и отдельно — три коротких хука для теста на разной аудитории.
Структура выводаМодель отвечает строго в JSON: тело сценария + массив из трёх хуков, чтобы n8n мог раскидать их по следующим шагам без ручного парсинга.
Точка контроляСценарий с хуками приходит тебе в Telegram. Не устраивает — просишь переписать, не трогая остальной конвейер.
2

Кадры

сценарий разбивается на сцены → картинки → каждая картинка оживает в видео
Разбивка на сценыТело ролика делится на 4 смысловых блока, плюс отдельный кадр под каждый из 3 хуков — итого 7 изображений на ролик.
Генерация изображенийGemini рисует кадр по промпту, собранному из сцены. Не устроил кадр — переген одной кнопкой, без пересборки остальных.
ОживлениеКаждая картинка уходит в Runway через kie.ai и превращается в короткий видеофрагмент с движением.
Сборка кадровСемь фрагментов складываются в порядок сценария и ждут следующий шаг — озвучку и лицо.
Нюанс: в промптах для картинок нельзя просить текст, буквы или надписи в кадре — модели анимации отрабатывают такие кадры плохо, текст "плывёт" и заметно ломает ролик. Только чистая картинка без текстовых элементов.
3

Аватар и голос

цифровой двойник проговаривает сценарий твоим лицом и голосом
Голос внутри HeyGenElevenLabs — не отдельный шаг синтеза речи, а голосовой движок, подключённый прямо внутри HeyGen. Клонированный голос обучен один раз на образцах твоей речи.
Аватар и липсинкHeyGen сразу генерирует видео с этим голосом и синхронизированным лицом цифрового двойника — озвучка и липсинк выходят одним запросом, а не двумя склеенными файлами.
Параллельная обработка хуковКаждый из трёх хуков озвучивается и анимируется отдельно — чтобы потом смонтировать три версии ролика с одним телом.
Точка контроляГотовая озвучка с аватаром приходит на подтверждение перед финальной сборкой.
Нюанс: числа в тексте для озвучки нужно писать словами, а не цифрами — аватар при цифрах в сценарии иногда сбоит и произносит их криво или залипает. "Двадцать пять", а не "25".
4

Сборка и выгрузка

склейка, тексты под площадки, публикация
Склейкаffmpeg на сервере собирает общее тело ролика с каждым из трёх хуков — на выходе три готовых видеофайла.
Тексты под площадкиОтдельная генерация постов под формат каждой сети: Reels, Shorts, TikTok, VK Клипы — разная длина и тон подписи.
ХранениеГотовые файлы и тексты выгружаются на диск/облако, откуда их забирает следующий шаг публикации.
ПубликацияАвто-выгрузка на площадки или отправка тебе на финальное согласование — зависит от режима, который выбрал.
Полный стек

Сервисы и их роль

n8nоркестратор — связывает все шаги и точки подтверждения
LLM (сценарий)текст сценария + 3 варианта хука в структурированном виде
Geminiгенерация изображений по сценам
Runway · kie.aiоживление статичных кадров в видео
ElevenLabsклонированный голос
HeyGenИИ-аватар и липсинк
Sunoфоновая музыка и звук
ffmpegсклейка тела ролика с хуками на сервере
Telegramподтверждение и правки на каждом шаге
Если собираешь сам

Что понадобится до старта

Аккаунты и API-доступыКо всем сервисам из стека — у некоторых (HeyGen, ElevenLabs, kie.ai) нужны платные планы, чтобы снять лимиты на длину и количество генераций.
Клон голоса и аватарЗаписать образцы голоса для ElevenLabs и отснять/загрузить материал для аватара в HeyGen — разовая настройка.
Сервер под n8n и ffmpegn8n можно поднять self-hosted или в облаке; ffmpeg должен стоять там же, где идёт финальная сборка видео.
Время на промпты и обработку ошибокПромпты для сценария и картинок нужно подбирать под свою нишу, а цепочку — учить восстанавливаться, если один из сервисов вернул брак или лёг по таймауту.
Где реально теряется время

Не в сервисах — в связке между ними

Промпт-инжиниринг под нишуУниверсального промпта нет — под каждую нишу и хук приходится подбирать формулировки, чтобы сцены не расходились по стилю.
Обработка сбоевЛюбой сервис в цепочке может вернуть ошибку или брак — без retry-логики и проверок весь конвейер встаёт на этом шаге.
Синхронизация точек контроляСогласования в Telegram должны идти строго по цепочке, не путая ролики между собой при параллельном запуске нескольких тем.
Масштабирование на много аккаунтовРазвести один рабочий процесс на десятки профилей и площадок без коллизий — отдельная инженерная задача поверх самой генерации.

Собрать под ключ быстрее, чем разбираться самому

Всё, что выше, я уже настроил и обкатал — со всеми точками, где всё ломается. Разворачиваю тот же конвейер под твою нишу, голос и лицо, без сборки методом проб и ошибок.

Оставить заявку на сборку