Кондинский нейросеть 2.0: полное руководство по генерации изображений и видео

Узнайте, как пользоваться нейросетью Кандинский 2.0 от Сбера: возможности, инструкции, промпты, ограничения и ответы на частые вопросы.

Что такое нейросеть Кандинский 2.0

Кандинский 2.0 — это российская нейросеть от Сбера для генерации изображений, анимации и видео по текстовым запросам. Она стала развитием первой модели ruDALL-E, выпущенной в ноябре 2021 года. Версия 2.0 появилась в 2023 году и быстро завоевала популярность благодаря бесплатному доступу и хорошему пониманию русского языка.

В отличие от зарубежных аналогов, таких как Midjourney или Stable Diffusion, Кандинский не требует подписки и работает без VPN. Это делает его особенно удобным для пользователей из России. Нейросеть доступна через несколько платформ: сайт Fusion Brain, чат-боты в Telegram и ВКонтакте, а также через виртуального ассистента «Салют».

Ключевая особенность Кандинского 2.0 — способность создавать изображения с нуля, редактировать загруженные фото, дорисовывать детали и даже генерировать короткие видеоролики. При этом модель понимает запросы более чем на 100 языках, но лучше всего работает с русским языком, что выгодно отличает её от многих конкурентов.

Как появился Кандинский 2.0 и чем отличается от других версий

История Кандинского началась с модели ruDALL-E XL, представленной в ноябре 2021 года. После нескольких обновлений появилась первая версия под названием Kandinsky. В апреле 2023 года вышла версия 2.1, которая, однако, уступала Midjourney и Stable Diffusion по реалистичности и детализации.

В июле 2023 года была выпущена версия 2.2, главным улучшением которой стала генерация фотореалистичных изображений высокого качества. Позже к ней добавили возможность создавать 4-секундные видеоролики по текстовым запросам.

В ноябре 2023 года на конференции AI Journey «Сбер» представил Кандинский 3.0 и отдельную модель Kandinsky Video. Версия 3.0 добавила поддержку русской культуры, фольклора и народных промыслов, таких как гжель и жостовская роспись. По состоянию на 2024 год актуальной остаётся версия 3.1, которая работает быстрее и точнее понимает сложные запросы.

Кандинский 2.0 — это промежуточная версия, которая заложила основу для последующих улучшений. Она доступна на сайте ruDALL-E и в некоторых чат-ботах, но для новых пользователей рекомендуется использовать более свежие версии через Fusion Brain.

Где можно использовать Кандинский 2.0

Нейросеть доступна на нескольких платформах, каждая из которых имеет свои особенности.

Fusion Brain — официальный сайт с полным функционалом. Здесь можно генерировать изображения, анимацию и видео, использовать ластик для удаления деталей, задавать негативные промпты и выбирать стили. Интерфейс полностью русскоязычный, есть подсказки и горячие клавиши.

Сайт ruDALL-E — упрощённая версия с урезанным функционалом. Позволяет выбрать версию модели (2.1, 2.2, 3.1 и другие) и сгенерировать изображение, но иногда работает нестабильно.

Чат-бот в Telegram (@kandinsky21_bot) — удобен для быстрой генерации картинок без регистрации. Поддерживает версии 2.1, 2.2 и 3.1. В боте можно смешивать изображения, переносить стиль и создавать стикеры, но недоступны расширенные настройки.

Чат-бот ВКонтакте — аналогичен Telegram-боту, но с ещё более простым интерфейсом. Подходит для быстрой визуализации идей.

Приложение «Салют» и «Салют ТВ» — можно генерировать изображения голосом, сказав «Включи художника».

СберБанк Онлайн — встроенная функция генерации изображений через виртуального ассистента.

Для доступа к расширенным функциям, таким как редактирование и генерация видео, рекомендуется зарегистрироваться на Fusion Brain через Сбер ID или GosKey.

Пошаговая инструкция: как сгенерировать изображение

Процесс генерации изображения в Кандинском 2.0 прост и интуитивно понятен. Рассмотрим его на примере Fusion Brain.

  1. Выберите соотношение сторон. От него зависит разрешение: для 1:1 — 1024×1024 px, для 16:9 — 1024×576 px, для 9:16 — 576×1024 px. Также доступны форматы 3:2 и 2:3.
  1. Составьте промпт (текстовый запрос). Опишите, что должно быть на изображении: объекты, действия, фон, стиль, освещение. Например: «Кот в костюме астронавта на фоне звёздного неба, фотореалистичный стиль».
  1. При необходимости укажите негативный промпт. Это описание того, чего не должно быть на картинке, например «без текста, без размытия». Негативные промпты помогают убрать нежелательные детали.
  1. Выберите стиль. Доступно 17 готовых стилей: фотореализм, цифровая живопись, акварель, аниме, 3D-рендер и другие. Если стиль не выбран, нейросеть создаст изображение в своём стиле.
  1. Нажмите кнопку генерации. Обычно результат появляется через 20–30 секунд. На каждый запрос выдаётся несколько вариантов, из которых можно выбрать лучший.

Если результат не устраивает, можно отредактировать промпт, добавить негативные формулировки или использовать ластик для удаления отдельных элементов. Важно помнить: при точечных правках фон и общая композиция сохраняются, меняются только указанные детали.

Как редактировать изображения и дорисовывать детали

Кандинский 2.0 позволяет не только создавать изображения с нуля, но и редактировать уже готовые. Это полезно, когда нужно изменить фон, добавить объект или исправить ошибку.

Редактирование по текстовому запросу. Загрузите изображение и напишите, что нужно изменить: «Замени фон на горный пейзаж» или «Добавь солнечные очки». Нейросеть перерисует указанные элементы, сохраняя общую композицию.

Дорисовка с помощью ластика. Если на изображении есть лишний объект или обрезанная деталь, используйте ластик, чтобы удалить ненужное, а затем выделите область и опишите, что должно быть на этом месте. Важно, чтобы новая область генерации пересекалась с исходным изображением — это повышает шансы на качественное продолжение.

Смешивание изображений. Можно загрузить две картинки, и нейросеть объединит их стили, композицию или отдельные элементы. Например, можно перенести палитру одного изображения на другое.

Создание вариаций. На основе загруженного изображения можно сгенерировать несколько его вариантов, изменив детали или стиль. Это удобно для подбора подходящего визуала.

Все эти функции доступны на Fusion Brain и в Telegram-боте (для версий 2.1 и 2.2). В чат-боте ВКонтакте редактирование недоступно.

Генерация анимации и видео в Кандинском 2.0

Помимо статичных изображений, Кандинский умеет создавать анимацию и короткие видеоролики. Это открывает дополнительные возможности для контент-мейкеров и маркетологов.

Анимация создаётся из нескольких сцен, каждая длительностью 4 секунды. Максимальное количество сцен — четыре. Для каждой сцены нужно написать отдельный промпт. Можно выбрать направление камеры: зум, отдаление, панораму слева направо или снизу вверх. Сцены можно менять местами. Время генерации анимации из четырёх сцен — около 10 минут. Соотношение сторон: 1:1, 9:16, 16:9. Скачивается в формате MP4.

Видео генерируется по одному текстовому запросу, без расширенных настроек. Максимальная длительность — 5 секунд (в более новых версиях до 10 секунд). Качество видео пока уступает изображениям, а время генерации — около 4 минут. Видео можно создавать на основе текста или оживлять статичные изображения (image-to-video).

Для генерации видео через Telegram-бота необходимо оставить заявку и дождаться одобрения. На Fusion Brain видео доступно сразу после регистрации.

Важно: негативные промпты не работают ни для анимации, ни для видео. Поэтому нужно тщательно формулировать запросы, чтобы избежать нежелательных элементов.

Как составлять эффективные промпты

Качество результата напрямую зависит от того, как вы сформулируете запрос. Вот несколько проверенных правил.

Начинайте с главного. Сначала укажите, кто или что должно быть на изображении, затем — действие, и только потом — детали. Например: «Девушка с розовыми волосами сидит в кафе, пьёт кофе, за окном дождь, мягкий свет».

Добавляйте детали. Фон, время суток, погода, цвета, настроение, крупность плана — всё это помогает нейросети точнее понять задачу. Чем больше деталей, тем выше вероятность получить нужный результат.

Упрощайте конструкции. Избегайте сложных предложений с деепричастными оборотами. Пишите короткими фразами: «Кот спит на диване, реализм, неяркие цвета».

Используйте прямые отсылки. Если хотите получить изображение в стиле известного художника или фильма, укажите это напрямую: «Закат в стиле Малевича» или «Кот и собака в стиле „Криминального чтива“».

Применяйте негативные промпты. Они помогают исключить нежелательные элементы: «без текста, без искажений, без лишних объектов».

Экспериментируйте. Если результат не устроил, меняйте формулировку, добавляйте или убирайте детали. Иногда достаточно одного слова, чтобы картинка стала лучше.

Подсматривайте чужие промпты. В интернете есть много примеров удачных запросов, которые можно адаптировать под свои задачи.

Ограничения и особенности работы Кандинского 2.0

Несмотря на все преимущества, у Кандинского есть ограничения, о которых стоит знать.

Качество видео. Видеоролики пока уступают по качеству изображениям. Они короткие (до 5–10 секунд) и не всегда точно соответствуют запросу. Для длинных роликов потребуются другие инструменты.

Сложные запросы. Нейросеть может по-разному интерпретировать сложные или абстрактные формулировки. Например, при генерации двух героев она иногда дублирует одного персонажа или смешивает их черты. В таких случаях помогает упрощение запроса и использование негативных промптов.

Галлюцинации. Иногда нейросеть добавляет лишние детали или искажает объекты. Это нормально для ИИ — нужно просто повторить генерацию или отредактировать результат.

Коммерческое использование. По умолчанию сгенерированные изображения можно использовать только в некоммерческих целях. Для коммерческих проектов требуется отдельное соглашение с SberAI.

Лимиты. В чат-ботах без регистрации действует лимит около 100 запросов в день. На Fusion Brain после регистрации лимитов практически нет.

Стабильность. Сайт ruDALL-E иногда работает нестабильно, а на Fusion Brain могут возникать сбои, когда нейросеть дублирует предыдущие генерации. В таких случаях помогает перезагрузка страницы.

Практические примеры использования Кандинского 2.0

Кандинский подходит для самых разных задач — от создания контента для соцсетей до прототипирования в дизайне.

Контент для соцсетей. SMM-специалисты используют нейросеть для генерации уникальных визуалов под каждый пост. Например, по промпту «Мопс в короне сидит на троне, картина в стиле Веласкеса» можно получить забавную картинку для развлекательного канала.

Маркетинг. Маркетологи создают изображения для рекламных кампаний, не завися от фотостоков. Промпт «Сочный бургер, картошка фри и бутылка колы на столе, яркие цвета» подойдёт для меню или рекламы фастфуда.

Образование. Преподаватели генерируют визуалы для уроков: исторические сцены, научные концепции, географические объекты. Например, «Закат в пустыне, максимальный реализм» поможет проиллюстрировать тему о природе.

Дизайн и прототипирование. Дизайнеры создают концепты персонажей, локаций и объектов для игр или рекламы. Промпт «Космический корабль возле чёрной дыры, sci-fi art» может стать основой для концепт-арта.

Личные проекты. Нейросеть позволяет создавать аватары, обложки, открытки и просто красивые картинки для себя. Например, «Медвежонок в лесу днём, жизнерадостная картинка, яркие цвета» в стиле 3D-рендера.

Быстрая визуализация идей. Если нужно быстро показать клиенту или коллеге, как может выглядеть продукт, Кандинский справится за пару минут. Даже простой промпт «Стол» в стиле 3D-рендера даст наглядный результат.

Часто задаваемые вопросы о Кандинском 2.0

Нужна ли регистрация для использования Кандинского?

Нет, если вы пользуетесь Telegram-ботом или ВКонтакте. Для доступа к расширенным функциям (редактирование, видео, история) потребуется регистрация на Fusion Brain через Сбер ID или GosKey.

Можно ли использовать изображения в коммерческих целях?

По умолчанию — только для некоммерческого использования. Для коммерческих проектов нужно заключить отдельное соглашение с SberAI.

Чем Кандинский отличается от Midjourney?

Кандинский бесплатен, понимает русский язык и доступен без VPN. Midjourney платный (от $10 в месяц), работает только с английским и требует VPN в России. По качеству изображений они сопоставимы, но у Midjourney больше художественных стилей.

Почему нейросеть иногда выдаёт странные результаты?

Это связано с «галлюцинациями» ИИ — модель может добавить лишние детали или исказить объекты. Попробуйте упростить запрос, добавить негативный промпт или повторить генерацию.

Как ускорить генерацию?

Время генерации зависит от сложности запроса и загруженности серверов. Для ускорения используйте простые промпты и меньшее количество сцен в анимации.

Можно ли генерировать видео без регистрации?

В Telegram-боте для видео нужно оставить заявку. На Fusion Brain видео доступно после регистрации.

Какие форматы файлов поддерживаются?

Изображения скачиваются в JPEG, кроме стиля «3D рендер» — он сохраняется в PNG. Анимация и видео — в MP4.

Вопросы и ответы

Что такое Кандинский 2.0 и чем он отличается от других версий?

Кандинский 2.0 — это нейросеть от Сбера для генерации изображений и анимации. Она появилась как развитие модели ruDALL-E. Версия 2.0 стала основой для более поздних обновлений: 2.1 добавила улучшенную детализацию, 2.2 — фотореализм и видео, а 3.0/3.1 — поддержку русской культуры и более быстрое выполнение запросов. Для новых пользователей рекомендуется использовать актуальную версию 3.1 через Fusion Brain.

Как бесплатно пользоваться нейросетью Кандинский?

Кандинский полностью бесплатен. Можно использовать Telegram-бота @kandinsky21_bot или чат-бота ВКонтакте без регистрации. Для расширенных функций (редактирование, видео, история) зарегистрируйтесь на Fusion Brain через Сбер ID или GosKey. Лимиты в ботах — около 100 запросов в день, на Fusion Brain после регистрации лимитов практически нет.

Какие форматы изображений поддерживает Кандинский?

Кандинский генерирует изображения в форматах JPEG и PNG (для стиля «3D рендер»). Доступны соотношения сторон 1:1, 16:9, 9:16, 3:2, 2:3. Разрешение зависит от ориентации: например, 1:1 — 1024×1024 px, 16:9 — 1024×576 px. Анимация и видео сохраняются в MP4.

Можно ли редактировать уже готовые изображения в Кандинском?

Да, можно. Загрузите изображение и напишите текстовый запрос, что нужно изменить: заменить фон, добавить объект или убрать детали. Также доступен ластик для удаления элементов и дорисовка с помощью выделения области. Функция смешивания позволяет объединять две картинки в одну.

Почему Кандинский иногда выдаёт странные или некачественные результаты?

Это связано с «галлюцинациями» ИИ — модель может добавить лишние детали, исказить объекты или неверно интерпретировать запрос. Чтобы улучшить результат, упростите промпт, добавьте негативный промпт (например, «без текста, без искажений») или повторите генерацию. Также помогает выбор конкретного стиля из списка.

Можно ли использовать сгенерированные изображения в коммерческих проектах?

По умолчанию изображения можно использовать только в некоммерческих целях, согласно пользовательскому соглашению. Для коммерческого использования необходимо заключить отдельное соглашение с SberAI. Контакты для связи указаны на официальном сайте Кандинского.