Как бизнесу использовать искусственный интеллект: обзор возможностей
К 2025 году ИИ отберёт работу у 85 млн человек . Но в то же время создаст огромное количество новых рабочих мест и возможностей для бизнеса. В каком…

К 2025 году ИИ отберёт работу у 85 млн человек. Но в то же время создаст огромное количество новых рабочих мест и возможностей для бизнеса. В каком лагере окажемся мы? Чтобы выиграть от расцвета ИИ, нужно уже сейчас понимать его возможности, а ещё лучше применять в своих проектах. Поэтому сегодня в мини-курсе мы подготовили обзор основных возможностей ИИ для бизнеса.
10 шагов:
1. Генерируем тексты с помощью GPT-3
2. Создаём изображения: DALL-E 2
3. Генерируем код: OpenAI Codex
4. Используем компьютерное зрение для автоматизации процессов
5. Создаём дипфейк-видео
6. Редактируем изображения с помощью нейросетей
7. Переводим аудио в текст
8. Копируем голос другого человека и исправляем акцент
9. Находим инсайты в массивах информации
10. Внедряем модели в бизнес: инструменты MLOps
1. Генерируем тексты с помощью GPT-3

GPT-3 — самый мощный и перспективный алгоритм генерации текстов на сегодня. Он уже умеет сочинять стихи, анализировать большие массивы текста, вести диалоги и отвечать на вопросы.
Вот примеры коммерческих применений GPT-3:
- HyperWrite — закончит предложение за вас, поменяет стиль вашего письма.
- Hypotenuse — описание продуктов по фотографии для e-commerce. WriteSonic, Rytr, Peppertype — маркетинговый копирайтинг.
- Copysmith — генерирует объявления для контекстной рекламы по нескольким ключевым словам.
- Replika — ИИ-компаньон.
- Latitude — текстовые квесты.
- Ещё 300+ сервисов с разбивкой по категориям можно посмотреть на GPT-3 Map.
- В скором времени ожидается релиз GPT-4 — эта модель будет содержать уже 100 трлн параметров, что в 500 раз больше GPT-3. А значит, генерация текстов будет ещё более качественной.
Как это применить? API в открытом доступе без листа ожидания. Однако для коммерческих проектов нужен счет в другой стране — РФ, Беларусь и Украина не поддерживаются.
В Сбере разработали русскоязычную модель ruGPT-3, есть API и готовые модели на GitHub. Также недавно в открытый доступ выложили языковые модели от Meta (экстремистская организация) и Яндекса.
2. Создаём изображения: DALL-E 2

Технология генерации изображений из текста также совершила мощный рывок за последний год. Нейронки уже могут конкурировать с художниками и иллюстраторами — и не только с любителями. Они умеют генерировать картинки с нуля по текстовому описанию, дорисовывать часть картинки, изменять заданное изображение. Примеры картинок можно посмотреть здесь.
Вот основные проекты для генерации изображений:
- DALL-E 2 — нейросеть от OpenAI, создателей GPT-3. Модель умеет добавлять/удалять объекты на изображении и создавать вариации заданных картинок. Пока только лист ожидания, но некоторым уже начали выдавать доступы. Есть и копии архитектуры на GitHub.
- В Сбере также адаптировали модель под русский язык и выложили на GitHub.
- Latent Diffusion — ещё одна модель, которая умеет генерировать и редактировать картинки по текстовому описанию. Код открыт, также можно поиграться в песочнице.
- GLIDE — диффузионная модель от OpenAI. В ней можно настроить баланс между скоростью генерации и качеством результата. Код открыт.
- Со всеми доступными генераторами изображений можно поиграться в этой демке на Huggingface.
3. Генерируем код: OpenAI Codex

Программисты тоже на прицеле у ИИ. Нейронки и здесь совершили скачок, обучившись на открытых репозиториях кода:
- OpenAI создали Codex — это модифицированная версия GPT-3, которая трансформирует обычный язык в код. На базе Codex уже есть ИИ-помощники для программистов, которые дополняют код (GitHub Copilot).
- Можно также генерировать программы из дизайнов Figma, объяснить написанный код человеческим языком, автоматически создавать юнит-тесты.
- Salesforce выложили в открытый доступ CodeGen — модель, которая превращает инструкции на обычном языке в код. Пишут, что их модель может конкурировать с Codex.
- Amazon на днях выпустили CodeWhisperer — собственного ИИ-помощника для программистов, который подстраивается под стиль разработчика и может генерировать более 10 строчек кода за раз.
- Kite, Tabnine — ИИ-плагины, которые предсказывают следующие строчки кода.
Как это применить? Генерировать код можно с помощью API Codex (модель code-davinci, пока что в листе ожидания). Нейросетке можно давать задание на обычном английском, и перебирать варианты.
Пример из недавнего: Codex сама написала аналог Wordle, Zelda и 3D-лабиринт — и всё это без кода от человека.
4. Используем компьютерное зрение для автоматизации процессов

Компьютерное зрение (Computer Vision, CV) — ИИ-технология, которая позволяет машинам «видеть»: распознавать объекты, отслеживать движение и т.д. Со многими задачами нейросети сейчас справляются лучше людей — они не устают, не ходят на обеды и перерывы. Вот несколько примеров проектов, которые используют компьютерное зрение для автоматизации процессов:
- Пирогов — диагностика ЛОР-заболеваний по снимкам.
- Reconstruct — отслеживание техники безопасности на стройке.
- Neatsy — определение подходящего размера кроссовок по снимку стопы.
- CattleCare — отслеживание операций на молочных фермах и диагностика болезней коров.
- BirdBuddy — умные скворечники, которые распознают вид птицы.
- Seek — приложение для определения съедобных грибов и ягод.
Как это применить? Начать можно с обучения собственной нейронки в этих no-code сервисах:
- Teachable Machine — сервис для создания собственной ИИ-модели от Google. Можно натренировать на своих сетах картинок и звуков прямо в браузере, затем выгрузить модель. Есть отличный FAQ.
- Lobe — сервис от Microsoft, работает локально на вашем компьютере. Принцип тот же: загружаете побольше фото, размечаете их — и все, модель тренируется.
- Roboflow — компьютерное зрение «как сервис». Можно натренировать свою модель из удобного интерфейса прямо в браузере.
- Далее можно погрузиться в TensorFlow и использовать их модели для трекинга тела, распознавания изображений и др.
5. Создаём дипфейк-видео

Видео становится всё более популярным каналом продаж и контактов с аудиторией. Однако работать с видео несравнимо дороже текста. На помощь опять приходят нейросети:
- Виртуальных говорящих людей позволяют сгенерировать проекты Synthesia и Soul Machines. Сервисы позволяют превратить текст в видео с говорящим дипфейк-актёром. У Synthesia также есть API.
- Rephrase называют себя Mailchimp для видео: можно написать текст с именем клиента, и нейросеть автоматически сгенерирует ему персональное дипфейк-видео. Стартап утверждает, что такие видео повышают CTR на десятки процентов.
- Unity недавно купили Ziva Dynamics — сервис для создания цифровых фотореалистичных аватаров. Посмотрите видео, качество деталей просто поражает.
- Похожие проекты есть в Unreal Engine и Nvidia.
- Самый популярный сценарий использования дипфейков — замена лиц в видео на знаменитостей. Подобные проекты Avatarify и Reface покоряли чарты App Store в прошлом году.
6. Редактируем изображения с помощью нейросетей

Фотошоп и ретушёры тоже уходят в прошлое. Самые популярные задачи по редактированию изображений уже неплохо берёт на себя ИИ:
- Убрать объекты на фото «в один клик» — Photoroom, Cleanup, Hama
- Убрать фон и объекты из видео — Runway
- Увеличить разрешение картинки — Upscale.media
- Убрать вотермарки — Watermark Remover
- Сжать картинки без потери качества — Shrink
- Редактировать картинки для каталогов e-commerce — Spyne
- Создать и редактировать иллюстрации — Designstripe
- Подобные сервисы можно запускать и самим, на базе EditGAN от Nvidia.
7. Переводим аудио в текст

Распознавание голоса — ещё одна большая сфера, куда стремительно внедряется ИИ. Варианты применения в бизнесе:
- ИИ-помощники для докторов. DeepScribe записывает беседу врача с пациентом, выделяет главное и автоматически заносит информацию в медкарту. Дубляж фильмов и сериалов + автоматический перевод на другие языки. Примеры: Papercup, Deepdub.
- ИИ-консультанты в банках и магазинах. Подобные решения создаёт южнокорейский стартап Deepbrain, который недавно стал «инновацией года» на выставке потребительской электроники СES.
- Чат-боты и виртуальные ассистенты: Tomoru, DeepVoice, Олег от Тинькофф.
- Перевод Zoom-созвонов в текст. Fireflies и Rewatch недавно подняли инвестиции на подобные решения.Ассистенты для колл-центров и отделов продаж — Balto, Gong.
Как это применить? Можно воспользоваться коробочными решениями для транскрибации аудио — Trint, Verbit.
Разработчики могут использовать речевые технологии Яндекса для распознавания (Speech-to-Text) и синтеза (Text-to-Speech). Своих голосовых ассистентов можно делать на базе Google Actions и Яндекс Диалоги.
8. Копируем голос другого человека и исправляем акцент

Передача эмоций и тональности раньше была проблемой для ИИ, но сейчас и здесь появляются прорывные решения. Netflix недавно «оживили» известного художника Энди Уорхола, чтобы озвучить документалку его голосом. Потребовалось всего 4 минуты аудиодорожки, чтобы обучить ИИ копировать голос и тон художника.
Вот примеры проектов в этой области:
- Cинтез и клонирование голоса: Respeecher. Можно заговорить голосом Барака Обамы, например. Похожий проект — Aflorithmic.
- Полезные продукты для создателей контента.Приложения для поздравлений голосом звёзд: Revoice, Famous Voice Changer, VoiceGaga.
- Исправление оговорок в подкастах с помощью ИИ: Descript, My own Voice.
- Изменение акцента говорящего: Sanas. Разговаривая по-английски, вы можете сделать себе американский или британский акцент. Основные клиенты — колл-центры из Индии и Филиппин, где у американских компаний сидит саппорт.
- Удаление слов из музыки: VocalRemover.
9. Находим инсайты в массивах информации

Данные — нефть 21 века. Но недостаточно просто иметь данные, важно правильно их обработать и вычленить инсайты. Поэтому Data Science стала одной из самых горячих сфер в области ИИ. Вот что можно делать на базе анализа «больших данных»:
- Выстраивать рекомендательные ленты. Теперь они есть не только в соцсетях: алгоритмы рекомендаций внедряют у себя интернет-магазины, порталы недвижимости, приложения для заказа еды и многие другие.
- Находить самые упоминаемые компании в соцсетях: Quiver Quant
- Оценивать резюме кандидатов на вакансии и предлагать лучших: Retrain
- Находить лидов, которые жалуются на решения конкурентов: Deep Talk
- Предсказывать спрос на продукты и подстраивать цены: Sniffie, PriceFx
- Планировать логистику в зависимости от пробок, состояния машин и других факторов: FarEye
- Прогнозировать заболевания: Promedmail
Как это применить? Начать можно с внедрения RPA-инструментов для автоматизации рутинных задач (Robotic Process Automation) — UiPath, Unqork. Чтобы разработать собственную модель, не обойтись без дата-сайентиста и ML-инженера. Код для моделей и датасеты можно найти на Kaggle.
10. Внедряем модели в бизнес: инструменты MLOps

Одних ИИ-моделей недостаточно, чтобы создать работающий продукт — нужно уметь их подтюнить, задеплоить, «подружить» с фронтендом и бэкендом. Это нетривиальная задача даже для разработчиков, из-за чего обычно требуется целая команда.
Но теперь появляются удобные инструменты MLOps (по аналогии с DevOps) — они демократизируют разработку ИИ-приложений. Несколько примеров:
- Облачные платформы для совместной ML-разработки: Vertex AI от Google, ML Space от Сбера, Sagemaker от Amazon и т.д. Предоставляют готовые окружения и ресурсы для разработки.
- No-code инструменты: Baseten. Через простой drag-and-drop интерфейс можно за пару часов собрать готовое приложение на базе ИИ-модели, либо встроить её у себя по API.
- Мониторинг и управление моделями: Modzy
- Синтетические данные для обучения моделей: Appen, Mostly AI
Чтобы оставаться «на острие» искусственного интеллекта и MLOps-инструментов, отслеживаем эти ресурсы:
- Конференции: NeurIPS, ACL
- Научные работы: Paperswithcode и выжимки на YouTube-канале Two Minute Papers
- Подкаст Лекса Фридман
- Email-рассылка The Sequence с обзорами ИИ-инструментов и стартапов.