ИИ-лекторий Обучение ← К программе
Урок 26 · Уровень 2 ⏱ 20 минут Для продолжающих · Как ИИ устроен изнутри

Нейросети за пределами текста:
картинки, голос, видео

Весь курс вы говорили с текстовыми нейросетями — и это правильная точка входа. Рядом целый мир: нейросети рисуют логотипы из наброска, клонируют голос, оживляют фотографии и монтируют ролики без съёмки. Этот урок — карта мира: что где лежит, что из этого польза, а что пока хайп.

🎯 После урока вы сможете: ориентироваться в областях нейросетей, выбирать инструмент от задачи (а не от рекламы) — и собрать свой набор из трёх инструментов под собственную работу.

Форматы дополняют друг друга: видео даёт живое объяснение, конспект — структуру для повторения.

Здесь будет видео урока. Плеер подключим, когда выберем хостинг: Kinescope, VK Видео или YouTube.

Первое, что важно понять: нейросети «для всего» не существует — у каждой области свои специалисты. Как в ремонте: есть электрик, есть сантехник, и вызывать одного вместо другого — дорого и мокро. Кто держит в голове карту специалистов, тот выбирает инструмент за минуту и не платит за хайп.

Семья нейросетей: четыре типа простыми словами

Языковые вы уже знаете лучше всех — это герои всего нашего курса: предсказывают следующее слово, пишут, рассуждают (урок 1). Кроме них в семье ещё три типа:

🎨СоздателиГенерируют новое: картинки, музыку, видео по вашему описанию. MidJourney, Suno, Runway — из этой породы.
🔧РеставраторыЧинят существующее: убирают шум из записи, повышают чёткость фото. Например, Adobe Podcast Enhance — «умыть» звук совещания.
👁«Глаза»Распознают и вырезают: найти объект, убрать фон с фото, стереть лишнего прохожего из кадра. Самые незаметные и самые ходовые.

Прежде чем идти по областям — про масштаб. Каталоги ИИ-инструментов насчитывают десятки тысяч сервисов, и каждый месяц выходят сотни новых. Запомнить всё невозможно и не нужно: держите карту областей и два-три проверенных имени в каждой — этого хватает на 95% рабочих задач. Ниже — именно такие имена, с объяснением, чем каждое хорошо.

Картинки и логотипы

Почему это работает: генеративная сеть выучила закономерности на миллиардах изображений — что такое «уютный», как падает свет, чем логотип отличается от фотографии. Ваш запрос она связывает с лучшими образцами из своего опыта и, по сути, играет в угадайку — и чаще всего угадывает поразительно точно. Отсюда правило: чем точнее описана цель, тем точнее угадывание — формула «объект + стиль + детали» из урока 5 работает и здесь.

Скорость прогресса тут нагляднее всего: MidJourney за два года прошла путь от примитивной мазни до фотореализма, который не отличить от съёмки. Грань «нарисовано или сфотографировано» уже пересечена — теперь выбор инструмента зависит только от вашей задачи:

MidJourneyMidJourneyэталон фотореализма

Сильнее всех в свете, фактурах и художественных стилях — выбор дизайнеров. Идеальна для обложек, концептов и «дорогой» картинки бренда. Платная, нужен VPN.

DALL·EDALL·Eкартинки прямо в ChatGPT

Козырь — встроенный GPT: поймёт даже сбивчивый запрос и сам допишет промпт. Лучший старт для тех, кому сложно формулировать: просто опишите смысл своими словами.

ШедеврумШедеврумЯндекс · бесплатно, без VPN

Самый доступный вход: приложение на русском, без карты и VPN. Быстрые иллюстрации к постам и идеям — то, с чего стоит начать пробовать генерацию вообще.

KandinskyKandinskyСбер · стили и дорисовка

Российский генератор с сильными художественными стилями, умеет дорисовывать и менять существующие картинки. Тоже бесплатный и без VPN.

RecraftRecraftвектор и фирменный стиль

Редкий зверь: генерирует векторную графику — иконки, логотипы, иллюстрации, которые можно масштабировать и править поэлементно. Для брендинга — самый практичный выбор.

IdeogramIdeogramтекст на картинке

Единственная в списке, кто надёжно ПИШЕТ текст внутри изображения — вывески, обложки, баннеры со слоганом. У остальных буквы до сих пор плывут.

Logo DiffusionLogo Diffusionлоготип из наброска

Берёт каракулю от руки — и возвращает десяток аккуратных вариантов логотипа в разных стилях. Путь «идея на салфетке → логотип» за десять минут.

NamelixNamelixнейминг

Вводите сферу бизнеса — получаете список коротких названий сразу с проверкой свободных доменов. Час мозгового штурма сжимается в пару минут.

Реставраторы и «чистильщики»: вторая жизнь контента

Почему это работает: эти сети учились на парах «испорченное — целое» и теперь умеют восстанавливать недостающее: убрать шум, вернуть резкость, раскрасить чёрно-белое фото. Отдельная порода — «глаза»: они распознают объекты на изображении, поэтому могут вырезать фон или стереть лишнего прохожего из кадра. Это самые незаметные и самые ходовые инструменты — экономят дизайнера каждый день:

Голос и музыка

Почему это работает: голосовой модели достаточно нескольких минут записи, чтобы выучить тембр, интонации и манеру речи, — дальше она читает любой текст «вашим» голосом. Музыкальные сети устроены как языковые, только предсказывают не слова, а звук: опишите настроение и жанр — получите трек.

И честная оборотная сторона, знакомая вам по уроку 10: тот же клон голоса — рабочий инструмент телефонных мошенников («мама, я попал в беду»). Теперь вы знаете, каким именно инструментом это делается, — и почему кодовое слово с семьёй не паранойя, а гигиена.

Видео и аватары

Почему это работает: видео-модели «насмотрели» миллионы роликов и выучили физику мира — как течёт вода, как развевается ткань, как человек поворачивает голову. Генерация идёт кадр за кадром с удержанием согласованности, и именно поэтому короткое видео получается блестяще, а на длинном ошибки накапливаются и сюжет «разваливается». Здесь сейчас главная гонка индустрии — область меняется быстрее всех остальных:

SoraSoraOpenAI · видео по тексту

Самый громкий генератор: описание словами → ролик с почти киношной картинкой. Демо Sora стали символом «видео-взрыва» — именно её ролики расходятся по сетям с подписью «это сделал ИИ?!»

VeoVeoGoogle · реализм движения

Сильнейшая физика и реализм движений: вода, ткань, свет ведут себя как настоящие. Конкурент Sora от Google DeepMind — их гонка и двигает всю область вперёд.

KlingKlingдлинные сцены

Китайский генератор, который тянет самые длинные связные сцены — там, где у других сюжет уже рассыпается. Показатель того, как быстро подтягиваются новые игроки.

RunwayRunwayмонтаж для профи

Не только генерация, но и «умный монтаж» готового видео: убрать объект из кадра, поменять фон, догенерить продолжение сцены. Инструмент видеографов, а не только энтузиастов.

HailuoHailuoоживление картинок

Загружаете картинку — получаете короткий ролик, где она движется: персонаж из MidJourney поворачивается и улыбается. Связка «MidJourney → Hailuo» — готовый конвейер анимированного контента.

HeyGenHeyGenвидео-аватар: клон лица

Клонирует ваше лицо — и дальше аватар читает на камеру любой текст. Сто роликов для соцсетей, не вставая со стула. В связке с ElevenLabs — полный «сам себе телеканал».

SynthesiaSynthesiaкорпоративное видео

Стандарт корпоративного обучения: аватары-ведущие читают ваши инструкции на десятках языков. Компании переводят на неё внутренние обучающие ролики целиком.

Рабочая связка из лекций практиков: HeyGen даёт картинку, ElevenLabs — голос: получается ролик с ведущим без съёмок, света и дублей. Ровно такой связкой собирают «говорящие головы» для соцсетей и обучающих курсов — и это доступно одному человеку без команды.

Макеты, документы, обучение

Последняя группа — «специалисты», о которых редко знают новички, хотя пользы в них на целый отдел:

Связки: куда всё движется

Главный тренд — не отдельные сервисы, а связки: одна нейросеть пишет текст, вторая рисует картинку, третья озвучивает, четвёртая публикует. Узнаёте? Это агентная логика из модуля 4 — только для медиа. Пример конвейера поста: текст — ChatGPT (формула из урока 5) → картинка — Шедеврум (промпт: объект+стиль) → озвучка для сторис — сервис класса ElevenLabs → публикация. Один человек делает работу мини-студии.

Как выбирать: правило одной минуты

Порядок всегда один: сначала задача — потом инструмент. Не «о, модный сервис, куда бы его применить», а «мне нужен логотип → область "картинки" → пробую доступное: Шедеврум/Kandinsky → мало — иду в классику». Это то же правило, что в уроке 20 про агентов: работу ищем для инструмента, а не наоборот. И трезвая оценка из практики: нейросети закрывают до 70% рутины в маркетинге и контенте — но слабы там, где нужны руки, эмпатия и живой контекст.

«Не бывает нейросети "для всего". Бывает задача — и специалист под неё. Кто ходит с картой — выбирает за минуту и не платит за хайп».

Главная мысль урока
💡

Три оговорки. Имена сервисов в этом уроке — ориентиры, а не догма: рынок меняется каждый месяц, области стабильны. Большая часть «мировой классики» требует VPN и зарубежных карт — начинайте с доступных аналогов. И правила модуля 3 никуда не деваются: фото сотрудников, голоса и документы компании в зарубежные сервисы не загружаем без согласований — это те же данные.

Практика · 7 минут

Соберите свой набор из трёх инструментов

Возьмите реальную задачу своей работы, где нужны не только тексты: пост с картинкой, ролик для сторис, логотип для проекта, озвучка инструкции, чистка записи созвона — что действительно лежит у вас в списке дел.

  1. Опишите задачу одной строкой.
  2. Разложите по карте урока: какая область → какой инструмент (начните с доступного) → что даёте на вход (промпт, набросок, текст, запись).
  3. Добавьте, что проверите на выходе, прежде чем пускать в работу. Впишите и нажмите «Проверить».
Черновик сохраняется в вашем браузере
Забрать в копилку · артефакт урока

Карта нейросетей по областям

КАРТА НЕЙРОСЕТЕЙ ПО ОБЛАСТЯМ — шпаргалка выбора

ПРАВИЛО: сначала задача → потом область → потом инструмент.
Имена сервисов — ориентиры (рынок меняется, области стабильны).

ОБЛАСТЬ            МИРОВАЯ КЛАССИКА     ДОСТУПНО ИЗ РФ      ТИПОВАЯ ЗАДАЧА
Тексты и анализ    ChatGPT, Claude      GigaChat, Алиса     весь наш курс
Картинки и лого    MidJourney, DALL·E   Шедеврум, Kandinsky пост, эскиз лого
  · лого из наброска: класс Logo Diffusion · нейминг: Namelix
Голос и музыка     ElevenLabs, Suno     Suno, SaluteSpeech  озвучка, джингл
  · чистка звука: Adobe Podcast Enhance
Видео и аватары    HeyGen, Runway       —                   ролик без съёмки
  · оживить картинку: Hailuo · связка: HeyGen + ElevenLabs
Макеты и доки      Uizard, Notion AI    —                   набросок → макет
«Чистильщики»      Remove.bg, Magic     есть в редакторах   убрать фон/шум
                    Eraser, BigJPG, Adobe Podcast (чистка звука)

СВЯЗКИ (тренд): текст → картинка → озвучка → публикация =
агентная логика для медиа. Один человек = мини-студия.

ГРАНИЦЫ: до 70% рутины — да · длинное видео — пока нет ·
эмпатия и руки — люди. Классика — VPN/карты: старт с доступных.
ПРАВИЛА М3 ДЕЙСТВУЮТ: голоса, фото, документы компании —
не загружать в зарубежные сервисы без согласования.

ПРОВЕРКА ВЫХОДА: руки/буквы на картинках · ударения в озвучке ·
факты в тексте (30 секунд, урок 2). Публикует человек.
✓ Скопировано
Проверьте себя · 7 вопросов

Тест по уроку

Вопрос 1 из 7
Почему не существует «одной нейросети для всего»?
AРазработчики не догадались её сделать
BУ каждой области — свои «специалисты», как электрик и сантехник в ремонте: выбор идёт от задачи
CСуществует, просто её скрывают
DПотому что нейросети конкурируют между собой
Вопрос 2 из 7
Нужен логотип, есть только карандашный набросок. Какой класс инструментов берём?
AЯзыковую модель — попросить описать логотип словами
B«Чистильщики» — отчистить набросок
CГенераторы изображений класса Logo Diffusion: берут набросок и возвращают варианты аккуратного логотипа
DНикакой: логотипы ИИ не умеет
Вопрос 3 из 7
Что даёт связка «HeyGen + ElevenLabs», которой пользуются практики?
AГотовый ролик с цифровым ведущим и озвучкой — без съёмки, света и дублей
BАвтоматический перевод сайта
CЗащиту от мошенников
DБесплатный VPN
Вопрос 4 из 7
Клонирование голоса — где польза, а где риск?
AТолько риск — технологию нужно запретить
BТолько польза — рисков нет
CЭто фантастика, голос клонировать нельзя
DПольза: озвучка книг и роликов без студии. Риск: тот же инструмент — у телефонных мошенников, поэтому кодовое слово с семьёй (урок 10) — не паранойя
Вопрос 5 из 7
Запись созвона шумная, голоса еле слышны. Какой тип нейросети поможет?
A«Создатели» — сгенерировать созвон заново
B«Реставраторы»: сервисы класса Adobe Podcast Enhance чистят шум до студийного звука
C«Глаза» — они всё видят
DЯзыковая модель — попросить её «послушать внимательнее»
Вопрос 6 из 7
Что сегодня — честное слабое место всех видео-нейросетей?
AНе умеют делать цветное видео
BРаботают только ночью
CДлинное связное видео: 10–20 секунд — отлично, трёхминутный сюжет — разваливается
DСлабых мест нет — всё уже идеально
Вопрос 7 из 7
Коллега: «Появился модный видео-сервис, срочно придумаем, куда его применить!» Что не так?
AПорядок перевёрнут: сначала задача → область → инструмент, а не «инструмент ищет работу»
BВсё так — новинки надо внедрять первыми
CНе так только то, что сервис видео, а не картинки
DНадо сначала спросить нейросеть, что она об этом думает
0 / 7

✓ Урок засчитан — прогресс сохранён
К программе курса