Делаем9 мин чтения

Как бизнесу использовать искусственный интеллект: обзор возможностей

К 2025 году ИИ отберёт работу у 85 млн человек . Но в то же время создаст огромное количество новых рабочих мест и возможностей для бизнеса. В каком…

К 2025 году ИИ отберёт работу у 85 млн человек. Но в то же время создаст огромное количество новых рабочих мест и возможностей для бизнеса. В каком лагере окажемся мы? Чтобы выиграть от расцвета ИИ, нужно уже сейчас понимать его возможности, а ещё лучше применять в своих проектах. Поэтому сегодня в мини-курсе мы подготовили обзор основных возможностей ИИ для бизнеса.

10 шагов:
1. Генерируем тексты с помощью GPT-3
2. Создаём изображения: DALL-E 2
3. Генерируем код: OpenAI Codex
4. Используем компьютерное зрение для автоматизации процессов
5. Создаём дипфейк-видео
6. Редактируем изображения с помощью нейросетей
7. Переводим аудио в текст
8. Копируем голос другого человека и исправляем акцент
9. Находим инсайты в массивах информации
10. Внедряем модели в бизнес: инструменты MLOps

1. Генерируем тексты с помощью GPT-3

GPT-3 — самый мощный и перспективный алгоритм генерации текстов на сегодня. Он уже умеет сочинять стихи, анализировать большие массивы текста, вести диалоги и отвечать на вопросы.
Вот примеры коммерческих применений GPT-3:

  • HyperWrite — закончит предложение за вас, поменяет стиль вашего письма.
  • Hypotenuse — описание продуктов по фотографии для e-commerce. WriteSonic, Rytr, Peppertype — маркетинговый копирайтинг.
  • Copysmith — генерирует объявления для контекстной рекламы по нескольким ключевым словам.
  • Replika — ИИ-компаньон.
  • Latitude — текстовые квесты.
  • Ещё 300+ сервисов с разбивкой по категориям можно посмотреть на GPT-3 Map.
  • В скором времени ожидается релиз GPT-4 — эта модель будет содержать уже 100 трлн параметров, что в 500 раз больше GPT-3. А значит, генерация текстов будет ещё более качественной.

Как это применить? API в открытом доступе без листа ожидания. Однако для коммерческих проектов нужен счет в другой стране — РФ, Беларусь и Украина не поддерживаются.

В Сбере разработали русскоязычную модель ruGPT-3, есть API и готовые модели на GitHub. Также недавно в открытый доступ выложили языковые модели от Meta (экстремистская организация) и Яндекса.

2. Создаём изображения: DALL-E 2

Технология генерации изображений из текста также совершила мощный рывок за последний год. Нейронки уже могут конкурировать с художниками и иллюстраторами — и не только с любителями. Они умеют генерировать картинки с нуля по текстовому описанию, дорисовывать часть картинки, изменять заданное изображение. Примеры картинок можно посмотреть здесь.

Вот основные проекты для генерации изображений:

  • DALL-E 2 — нейросеть от OpenAI, создателей GPT-3. Модель умеет добавлять/удалять объекты на изображении и создавать вариации заданных картинок. Пока только лист ожидания, но некоторым уже начали выдавать доступы. Есть и копии архитектуры на GitHub.
  • В Сбере также адаптировали модель под русский язык и выложили на GitHub.
  • Latent Diffusion — ещё одна модель, которая умеет генерировать и редактировать картинки по текстовому описанию. Код открыт, также можно поиграться в песочнице.
  • GLIDE — диффузионная модель от OpenAI. В ней можно настроить баланс между скоростью генерации и качеством результата. Код открыт.
  • Со всеми доступными генераторами изображений можно поиграться в этой демке на Huggingface.

3. Генерируем код: OpenAI Codex

Программисты тоже на прицеле у ИИ. Нейронки и здесь совершили скачок, обучившись на открытых репозиториях кода:

  • OpenAI создали Codex — это модифицированная версия GPT-3, которая трансформирует обычный язык в код. На базе Codex уже есть ИИ-помощники для программистов, которые дополняют код (GitHub Copilot).
  • Можно также генерировать программы из дизайнов Figma, объяснить написанный код человеческим языком, автоматически создавать юнит-тесты.
  • Salesforce выложили в открытый доступ CodeGen — модель, которая превращает инструкции на обычном языке в код. Пишут, что их модель может конкурировать с Codex.
  • Amazon на днях выпустили CodeWhisperer — собственного ИИ-помощника для программистов, который подстраивается под стиль разработчика и может генерировать более 10 строчек кода за раз.
  • Kite, Tabnine — ИИ-плагины, которые предсказывают следующие строчки кода.

Как это применить? Генерировать код можно с помощью API Codex (модель code-davinci, пока что в листе ожидания). Нейросетке можно давать задание на обычном английском, и перебирать варианты.

Пример из недавнего: Codex сама написала аналог Wordle, Zelda и 3D-лабиринт — и всё это без кода от человека.

4. Используем компьютерное зрение для автоматизации процессов

Компьютерное зрение (Computer Vision, CV) — ИИ-технология, которая позволяет машинам «видеть»: распознавать объекты, отслеживать движение и т.д. Со многими задачами нейросети сейчас справляются лучше людей — они не устают, не ходят на обеды и перерывы. Вот несколько примеров проектов, которые используют компьютерное зрение для автоматизации процессов:

  • Пирогов — диагностика ЛОР-заболеваний по снимкам.
  • Reconstruct — отслеживание техники безопасности на стройке.
  • Neatsy — определение подходящего размера кроссовок по снимку стопы.
  • CattleCare — отслеживание операций на молочных фермах и диагностика болезней коров.
  • BirdBuddy — умные скворечники, которые распознают вид птицы.
  • Seek — приложение для определения съедобных грибов и ягод.

Как это применить? Начать можно с обучения собственной нейронки в этих no-code сервисах:

  • Teachable Machine — сервис для создания собственной ИИ-модели от Google. Можно натренировать на своих сетах картинок и звуков прямо в браузере, затем выгрузить модель. Есть отличный FAQ.
  • Lobe — сервис от Microsoft, работает локально на вашем компьютере. Принцип тот же: загружаете побольше фото, размечаете их — и все, модель тренируется.
  • Roboflow — компьютерное зрение «как сервис». Можно натренировать свою модель из удобного интерфейса прямо в браузере.
  • Далее можно погрузиться в TensorFlow и использовать их модели для трекинга тела, распознавания изображений и др.

5. Создаём дипфейк-видео

Видео становится всё более популярным каналом продаж и контактов с аудиторией. Однако работать с видео несравнимо дороже текста. На помощь опять приходят нейросети:

  • Виртуальных говорящих людей позволяют сгенерировать проекты Synthesia и Soul Machines. Сервисы позволяют превратить текст в видео с говорящим дипфейк-актёром. У Synthesia также есть API.
  • Rephrase называют себя Mailchimp для видео: можно написать текст с именем клиента, и нейросеть автоматически сгенерирует ему персональное дипфейк-видео. Стартап утверждает, что такие видео повышают CTR на десятки процентов.
  • Unity недавно купили Ziva Dynamics — сервис для создания цифровых фотореалистичных аватаров. Посмотрите видео, качество деталей просто поражает.
  • Похожие проекты есть в Unreal Engine и Nvidia.
  • Самый популярный сценарий использования дипфейков — замена лиц в видео на знаменитостей. Подобные проекты Avatarify и Reface покоряли чарты App Store в прошлом году.

6. Редактируем изображения с помощью нейросетей

Фотошоп и ретушёры тоже уходят в прошлое. Самые популярные задачи по редактированию изображений уже неплохо берёт на себя ИИ:

  • Убрать объекты на фото «в один клик» — Photoroom, Cleanup, Hama
  • Убрать фон и объекты из видео — Runway
  • Увеличить разрешение картинки — Upscale.media
  • Убрать вотермарки — Watermark Remover
  • Сжать картинки без потери качества — Shrink
  • Редактировать картинки для каталогов e-commerce — Spyne
  • Создать и редактировать иллюстрации — Designstripe
  • Подобные сервисы можно запускать и самим, на базе EditGAN от Nvidia.

7. Переводим аудио в текст

Распознавание голоса — ещё одна большая сфера, куда стремительно внедряется ИИ. Варианты применения в бизнесе:

  • ИИ-помощники для докторов. DeepScribe записывает беседу врача с пациентом, выделяет главное и автоматически заносит информацию в медкарту. Дубляж фильмов и сериалов + автоматический перевод на другие языки. Примеры: Papercup, Deepdub.
  • ИИ-консультанты в банках и магазинах. Подобные решения создаёт южнокорейский стартап Deepbrain, который недавно стал «инновацией года» на выставке потребительской электроники СES.
  • Чат-боты и виртуальные ассистенты: Tomoru, DeepVoice, Олег от Тинькофф.
  • Перевод Zoom-созвонов в текст. Fireflies и Rewatch недавно подняли инвестиции на подобные решения.Ассистенты для колл-центров и отделов продаж — Balto, Gong.

Как это применить? Можно воспользоваться коробочными решениями для транскрибации аудио — Trint, Verbit.

Разработчики могут использовать речевые технологии Яндекса для распознавания (Speech-to-Text) и синтеза (Text-to-Speech). Своих голосовых ассистентов можно делать на базе Google Actions и Яндекс Диалоги.

8. Копируем голос другого человека и исправляем акцент

Передача эмоций и тональности раньше была проблемой для ИИ, но сейчас и здесь появляются прорывные решения. Netflix недавно «оживили» известного художника Энди Уорхола, чтобы озвучить документалку его голосом. Потребовалось всего 4 минуты аудиодорожки, чтобы обучить ИИ копировать голос и тон художника.

Вот примеры проектов в этой области:

  • Cинтез и клонирование голоса: Respeecher. Можно заговорить голосом Барака Обамы, например. Похожий проект — Aflorithmic.
  • Полезные продукты для создателей контента.Приложения для поздравлений голосом звёзд: Revoice, Famous Voice Changer, VoiceGaga.
  • Исправление оговорок в подкастах с помощью ИИ: Descript, My own Voice.
  • Изменение акцента говорящего: Sanas. Разговаривая по-английски, вы можете сделать себе американский или британский акцент. Основные клиенты — колл-центры из Индии и Филиппин, где у американских компаний сидит саппорт.
  • Удаление слов из музыки: VocalRemover.

9. Находим инсайты в массивах информации

Данные — нефть 21 века. Но недостаточно просто иметь данные, важно правильно их обработать и вычленить инсайты. Поэтому Data Science стала одной из самых горячих сфер в области ИИ. Вот что можно делать на базе анализа «больших данных»:

  • Выстраивать рекомендательные ленты. Теперь они есть не только в соцсетях: алгоритмы рекомендаций внедряют у себя интернет-магазины, порталы недвижимости, приложения для заказа еды и многие другие.
  • Находить самые упоминаемые компании в соцсетях: Quiver Quant
  • Оценивать резюме кандидатов на вакансии и предлагать лучших: Retrain
  • Находить лидов, которые жалуются на решения конкурентов: Deep Talk
  • Предсказывать спрос на продукты и подстраивать цены: Sniffie, PriceFx
  • Планировать логистику в зависимости от пробок, состояния машин и других факторов: FarEye
  • Прогнозировать заболевания: Promedmail

Как это применить? Начать можно с внедрения RPA-инструментов для автоматизации рутинных задач (Robotic Process Automation) — UiPath, Unqork. Чтобы разработать собственную модель, не обойтись без дата-сайентиста и ML-инженера. Код для моделей и датасеты можно найти на Kaggle.

10. Внедряем модели в бизнес: инструменты MLOps

Одних ИИ-моделей недостаточно, чтобы создать работающий продукт — нужно уметь их подтюнить, задеплоить, «подружить» с фронтендом и бэкендом. Это нетривиальная задача даже для разработчиков, из-за чего обычно требуется целая команда.

Но теперь появляются удобные инструменты MLOps (по аналогии с DevOps) — они демократизируют разработку ИИ-приложений. Несколько примеров:

  • Облачные платформы для совместной ML-разработки: Vertex AI от Google, ML Space от Сбера, Sagemaker от Amazon и т.д. Предоставляют готовые окружения и ресурсы для разработки.
  • No-code инструменты: Baseten. Через простой drag-and-drop интерфейс можно за пару часов собрать готовое приложение на базе ИИ-модели, либо встроить её у себя по API.
  • Мониторинг и управление моделями: Modzy
  • Синтетические данные для обучения моделей: Appen, Mostly AI

Чтобы оставаться «на острие» искусственного интеллекта и MLOps-инструментов, отслеживаем эти ресурсы:

От чтения к навыку

Claude Code для продактов и предпринимателей

Тренажёр по мотивам живого вебинара: фреймворк АРКА (Агент-Папка-Артефакт) и 5 настоящих кейсов — лидогенерация на Яндекс.Директ, B2B-продажи через сигналы (вакансии), SDR-конвейер, генератор КП, уборка CRM. Установка и доступ из России, реальные команды Claude Code в тренажёре терминала, CLAUDE.md, GitHub-страховка, MCP и hooks, путь от потребности пользователя (JTBD/CJM/PRD) до сборки. Финал — капстоун: адаптируйте один кейс под свой продукт или бизнес.

6 модулей · 27 уроков · первый урок открыт

Посмотреть курс

Ещё в рубрике «ИИ в работе»

Все материалы рубрики

Разборы по средам

Одно письмо в неделю с тем, что действительно изменилось.

Одно письмо в неделю. Отписаться можно в один клик.