Текст → голос → YouTube: ШІ сам робить озвучення
ШІ сам працює з API: перетворює довгий текст на природне озвучення, збирає цілісний MP3, надсилає його в Telegram із плеєром і розкладає на Google Диску — а далі з цього аудіо система автопублікації робить ролик на YouTube.
Власна розробкаОзвучує розбори для каналу «Слово і Дух»
- Розділ — за ~35 секунд
- До 25 хвилин звуку за раз
- Повʼязана з автопублікацією YouTube
01Схема: текст → ШІ-агент → Gemini TTS → FFmpeg → Telegram і Google Диск → YouTube
01Як було
Щоб перетворити довгий текст на аудіо для публікації, доводилося вручну запускати озвучення шматками, склеювати їх, давати файлам назви, розкладати в архіві й надсилати. Кожен розділ — та сама рутина, а помилка в назві потім плутає весь архів.
02Що змінилося
- Розділ — за пів хвилини
15 хвилин готового звуку генеруються приблизно за 35 секунд, до 25 хвилин — одним запитом.
- Природний голос
довгий текст озвучується цілком, без нарізання й склеювань.
- Файл одразу там, де потрібен
MP3 із плеєром у Telegram і в архіві Google Диска — з єдиною назвою.
- Далі — YouTube
з аудіо система автопублікації робить ролик для каналу «Слово і Дух».
03Як це працює
- 01
Текст розділу йде ШІ-агенту
- 02
Агент чистить розмітку й звіряє кожне слово
- 03
Нейромережа озвучує, файл збирається в MP3
- 04
Аудіо — в Telegram, на Диск і далі на YouTube
Той самий підхід — під ваше завдання
Тут це розбори Біблії. Та сама звʼязка «текст → голос → публікація» підходить для будь-якого текстового контенту.
- 01Блоги й медіа
аудіоверсія кожної статті — в подкаст і в Telegram-канал.
- 02Онлайн-школи
озвучення уроків і конспектів, зокрема кількома мовами.
- 03Бізнес
голосові інструкції для працівників, новини компанії, озвучення презентацій.
- 04Книжки й курси
аудіокнига за розділами, з архівом версій і єдиними назвами файлів.
Голос, мова, формат і куди надсилати — налаштовується під вас.
Під капотомТехнічні деталі — для фахівців
- Дві версії системи
конвеєр на n8n з паралельним озвученням і ШІ-агент, який сам викликає API озвучення й збирає файл.
- Перевірка слів
після очищення розмітки система звіряє послідовність слів з оригіналом — нічого не губиться й не змінюється.
- Надійність
у версії на n8n збійний запит повторюється, а відсутні шматки доозвучуються повторним проходом — файл надходить цілим.
- MP3 обовʼязковий
25 хвилин у WAV — це 74 МБ, а Telegram приймає до 50 МБ, тому FFmpeg завжди збирає MP3.
Стек
Потрібна схожа система?
Опишіть процес, і я запропоную, що автоматизувати насамперед. Безкоштовно.