Делаем9 мин чтения

Как создавать изображения с помощью ИИ: мини-курс

Помните, были такие профессии — «художник» и «иллюстратор»? Ещё пару лет назад говорили, что ИИ не сможет заменить креативные профессии, но с приходом…

Помните, были такие профессии — «художник» и «иллюстратор»? Ещё пару лет назад говорили, что ИИ не сможет заменить креативные профессии, но с приходом доступных нейросетей многие поменяли точку зрения. DALL-E и Stable Diffusion уже могут создавать картинки, забирающие призы на конкурсах художников.

Это приведёт к тому, что к 2025 году ИИ отберёт работу у 85 млн человек. Но в то же время создаст огромное количество новых рабочих мест и возможностей для бизнеса. Поэтому сегодня в мини-курсе — обзор самого яркого направления ИИ на сегодня: генерации и редактирования изображений.

10 шагов:
1. Получаем доступ к DALL-E
2. Учимся писать запросы к ИИ
3. Генерируем изображения с помощью Stable Diffusion
4. Генерируем арт в MidJourney
5. Используем inpainting для редактирования изображений
6. Удаляем фон и ненужные объекты на изображении
7. Используем дипфейки для замены лиц
8. Генерируем 3D-изображения
9. Создаём дипфейк-видео
10. Изучаем основы машинного обучения

1. Получаем доступ к DALL-E

Технология генерации изображений из текста совершила мощный рывок за последний год. OpenAI первыми произвели фурор с их моделью DALL-E.
На днях они открыли доступ без листа ожидания: регистрироваться здесь, также доступен API. К сожалению, не для всех стран — при попытке создать аккаунт с номером телефона РФ/Беларуси/Украины выходит ошибка.

Поэтому план действий таков:

  1. Подключаем VPN с туннелем из поддерживаемой страны.
  2. Указываем виртуальный номер телефона при регистрации — есть много сервисов по типу OnlineSim, Receive SMS и других. Лучше купить платный номер — большинство бесплатных забанены.
  3. После регистрации будет доступно 50 бесплатных генераций, ещё 15 будут давать ежемесячно. Когда триал закончится, попросят привязать карту из «дружественной страны». Для коммерческих проектов придётся открывать счет за рубежом.

2. Учимся писать запросы к ИИ

Основной навык, который требуется при работе со всеми генераторами — написание текстовых запросов (промтов). Появилась целая наука «prompt architecture» — как спросить у нейросетки, чтобы получить интересные результаты.

Вкратце, процесс можно описать так:

  • «Сырой запрос» — описываем объект, который мы хотим сгенерировать, на английском языке. Примеры: panda, a warrior with a sword, skeleton.
  • Добавляем к сырому запросу требуемый стиль изображения. Примеры: realistic, oil painting, pencil drawing, concept art.
  • Стиль художника. Может полностью преобразить изображение. Например, если вы хотите что-то абстрактное, можно добавить «made by Pablo Picasso».
  • Завершающие штрихи. Тут фантазия может разыграться, что приводит к запросам длиннее этой рассылки. Вы можете добавить к промту что угодно, вот некоторые популярные штрихи: surrealism, the most beautiful image ever seen, 4K, dramatic lighting, epic composition. В общем, алгоритму можно сказать что-то вроде «максимальное количество деталей» и он их нарисует.

Для более полного погружения рекомендуем эти гайды:

  • DALL-E Prompt Book — подробный гайд на 80 страниц про архитектуру запросов к DALL-E 2
  • Руководство по использованию нейросети Midjourney — как правильно писать запросы, какие параметры прописывать и т.д.
  • Prompt Builder — пошаговый конструктор запросов к популярным генераторам.
  • Prompt Base — маркетплейс промтов для DALL-E, Stable Diffusion и GPT-3. За пару баксов можно узнать выигрышные запросы по разным категориям. Можно продавать и свои удачные промты.

3. Генерируем изображения с помощью Stable Diffusion

В отличие от OpenAI (который далеко не Open), ребята из стартапа Stability AI решили сделать «открытый генератор». Он заточен на создание своих сервисов — код открыт, параметры модели также выложили в опенсорс. При этом качество генерации сопоставимо с DALL-E 2.

Протестировать Stable Diffusion проще всего с помощью Dream Studio — веб-сервиса для генерации картинок. Зарегистрироваться может любой желающий, каждому выдаётся 200 кредитов бесплатно (от 20 до 200 генераций, в зависимости от параметров).

Далее настраиваем сами параметры генерации:

  • Width, height — размеры картинки в пикселях.
  • Cfg Scale — параметр «случайности». Чем он выше, тем ближе будет генерация к вашему запросу, но качество может пострадать.
  • Steps — число шагов генерации. Чем больше шагов, тем дольше идёт генерация и выше качество картинки. Также быстрее проедаются кредиты, из-за более высокой нагрузки на сервер.
  • Number of Images — число вариантов финального изображения по вашему запросу.

4. Генерируем арт в MidJourney

Ещё один генератор MidJourney также недавно стал доступен всем желающим. Генерация происходит через сервер в Дискорде, который набрал уже почти 3 миллиона участников. Можно подключить их бота и на своём сервере.

Есть и веб-версия, но в ней пока нельзя генерировать картинки. Можно смотреть на свои и чужие работы и делать поиск по промтам. Лучше всего у MidJourney получается генерировать арт в различных стилях.

После того как вы зашли в их Дискорд, можно начать генерировать. Для этого вводим /imagine prompt: и ваш запрос. Перед вами появятся четыре варианта изображения c набором команд. Можно масштабировать избранные (U — upscale) или запросить новые версии (V — versions).

Несколько интересных фишек MidJourney:

  • Изменение формата изображений. По умолчанию 1:1. Если нужно поменять, то в конце промта добавляем --ar и соотношение сторон. Например: --ar 4:3.
  • Image prompt. Можно задать исходную картинку, от стиля которой генератор будет отталкиваться. Для этого добавляем ссылку на картинку в запрос.
  • Ключевые слова. На Github есть целая библиотека удачных запросов с примерами.

Более подробно про MidJourney можете прочитать в этом гайде.

5. Используем inpainting для редактирования изображений

Помимо собственно генерации изображений, можно попросить нейронку «продолжить» существующую картинку:

  • В DALL-E недавно добавили функцию Outpainting — это продолжение генерации изображения за его первоначальными границами. Так можно развить генерацию в новых направлениях, на базе вашего текстового описания. Подобную фичу недавно выкатили и в Stable Diffusion — вот видеообзор.
  • Загружаем свою картинку и выделяем на ней области, которые хотим поменять. Пишем запрос и нейронка отредактирует изображение.
  • Zmo.ai — как фотошоп, только с текстом. Выделяете нужный фрагмент и вписываете то, что хотите поменять. Всю остальную работу выполняет нейросеть. До 12 изображений в месяц бесплатно.
  • Для редактирования лиц можно использовать Neural.love. Нажимаем иконку изображения, выбираем фото и указываем новый стиль. Вот краткая инструкция с примерами.

На волне хайпа по генераторам, появилось множество новых ИИ-моделей и надстроек над уже существующими. Вот список из 45 ИИ-сервисов с разбивкой по категориям: генерация/трансформация/классификация контента. Ещё хорошая подборка сервисов есть на Hugging Face, там же можно протестировать разные генераторы.

6. Удаляем фон и ненужные объекты на изображении

Фотошоп и ретушёры тоже уходят в прошлое. Самые популярные задачи по редактированию изображений уже неплохо берёт на себя ИИ:

  • Убрать объекты на фото «в один клик» — Photoroom, Cleanup, Hama
  • Убрать фон и объекты из видео — RunwayУвеличить разрешение картинки — Neural.love, Upscale.mediaУбрать вотермарки — Watermark Remover
  • Сжать картинки без потери качества — ShrinkРедактировать картинки для каталогов e-commerce — Spyne
  • Создать и редактировать иллюстрации — Designstripe
  • Подобные сервисы можно запускать и самим, на базе EditGAN от Nvidia.

7. Используем дипфейки для замены лиц

Ещё один популярный сценарий использования нейронок — смешивание лиц. Загружаете свои фотографии — нейросеть обнаруживает на них лица и заменяет. Протестировать можно в этих сервисах:

Некоторые звёзды уже начали продавать своих «цифровых двойников». Например, Брюс Уиллис продал права на свою внешность ИИ-стартапу Deepcake. Так они официально смогут использовать цифрового Брюса для съёмки в будущих фильмах и рекламных роликах.

А в Южной Корее даже президенты заводят дипфейков. Так Юн Сок Юль покорил сердца молодого населения Кореи: cначала в пиар-кампании ему завели дипфейк-клона, который травил шутки и цитировал мемы. Затем, чтобы окончательно добить других кандидатов, уже настоящий Юль запустил NFT-коллекцию и выступил в поддержку крипты.

8. Генерируем 3D-изображения

Генерация картинок — это только первый этап. Уже наступает эра синтеза 3D-моделей:

  • Snap недавно представили технологию NeROIC — это новый способ создания трёхмерных моделей из общедоступных фотографий и видео. Нейронка сама додумывает недостающие виды изображения и синтезирует 3D-модель. Для полученного объекта можно изменить освещение и цветовую гамму. Модель выложили на GitHub, можно протестировать на своих данных.
  • Nvidia на своей недавней презентации представили похожую модель Get3D.
  • Google опубликовали статью про их новую модель для создания 3D-аватаров из обычных фото и видео. Нейронка уже неплохо научилась трансформировать изображения в 3D-модели, без необходимости использовать дорогостоящие датчики.
  • Epic Games выкатили RealityScan — мобильное приложение для 3D-сканирования объектов. С помощью обычного iPhone пользователи могут оцифровывать объекты реального мира, превращая их в трёхмерные модели. Продукт на выходе можно загрузить на 3D-платформу Sketchfab.
  • Если мы и правда будем жить в метавселенных, выживет только тот бизнес, которые быстрее всех адаптируется к виртуальным мирам. А с помощью нейросетей наполнять эти миры станет на порядки проще и дешевле.

9. Создаём дипфейк-видео

В генерации картинок уже сорваны «низковисящие фрукты», теперь идёт битва за первенство в генерации видео. Технологические гиганты активно смотрят в эту сторону:

  • Apple выложили в опенсорс нейросетку NeuMan для создания дипфейк-видео. Нужно только скормить сетке 10-секундный обучающий ролик с человеком — а потом сгенерировать видео, в котором этот человек делает что угодно. Основным сценарием использования указывают AR-игры.
  • Meta (запрещенная в РФ) на днях опубликовала анонс Make-A-Video — нейросети, которая генерирует короткие ролики по текстовому запросу. Она работает на манер DALL-E и Midjourney, но вместо статичных изображений создаёт короткие ролики. Пока на ранней стадии разработки, видео выходят в низком качестве и с заметными артефактами. Обещают в скором времени выпустить в закрытый доступ.
  • Виртуальных говорящих людей позволяют сгенерировать проекты Synthesia и Soul Machines. Сервисы позволяют превратить текст в видео с говорящим дипфейк-актёром. У Synthesia также есть API.
  • Некоторые умельцы адаптируют Stable Diffusion под задачу генерации видео — смотрите пример в Github, протестировать можно в Google Colab.

10. Изучаем основы машинного обучения

Общедоступные модели по типу Stable Diffusion мощно снизили порог входа в генерацию контента. Но самое интересное получается, если подтюнить и модифицировать модель — так можно создать нейронку для любой нишевой задачи, даже генерации пышных аниме-дам.

Поэтому если вы хотите заниматься этим всерьёз, нужно погружаться в сферу машинного обучения. Начать можно с отличных гайдов от Вастрика и Jon Stokes.

И одних ИИ-моделей недостаточно, чтобы создать работающий продукт — нужно уметь их задеплоить, «подружить» с фронтендом и бэкендом. Но сейчас появляются удобные инструменты MLOps (по аналогии с DevOps) — они демократизируют разработку ИИ-приложений. Несколько примеров:

  • Облачные платформы для совместной ML-разработки: Vertex AI от Google, ML Space от Сбера, Sagemaker от Amazon и т.д. Предоставляют готовые окружения и ресурсы для разработки.
  • No-code инструменты: Baseten. Через простой drag-and-drop интерфейс можно за пару часов собрать готовое приложение на базе ИИ-модели, либо встроить её у себя по API.
  • Сообщества со встроенными средами разработки — Kaggle, Hugging Face.

Чтобы оставаться «на острие» искусственного интеллекта и MLOps-инструментов, отслеживаем эти ресурсы:

От чтения к навыку

Claude Code для продактов и предпринимателей

Тренажёр по мотивам живого вебинара: фреймворк АРКА (Агент-Папка-Артефакт) и 5 настоящих кейсов — лидогенерация на Яндекс.Директ, B2B-продажи через сигналы (вакансии), SDR-конвейер, генератор КП, уборка CRM. Установка и доступ из России, реальные команды Claude Code в тренажёре терминала, CLAUDE.md, GitHub-страховка, MCP и hooks, путь от потребности пользователя (JTBD/CJM/PRD) до сборки. Финал — капстоун: адаптируйте один кейс под свой продукт или бизнес.

6 модулей · 27 уроков · первый урок открыт

Посмотреть курс

Ещё в рубрике «ИИ в работе»

Все материалы рубрики

Разборы по средам

Одно письмо в неделю с тем, что действительно изменилось.

Одно письмо в неделю. Отписаться можно в один клик.