Вы нашли инструкцию. На двенадцатой минуте ей понадобился Python именно 3.10, потом Git, потом чекпоинт на 6,5 ГБ с хостинга, который режет скорость анонимным скачиваниям. Ещё через сорок минут в консоли появилось torch.OutOfMemoryError: CUDA out of memory, и ноутбук закрылся.
Или вы сразу перешли к честной версии: NVIDIA в вашей машине просто нет. У вас MacBook или рабочий ноутбук со встроенной графикой, а каждое руководство молча предполагает обратное.
Обе дороги упираются в один вопрос: а можно просто в браузере? Можно. Но онлайн-генераторы забирают у вас почти все ручки, вокруг которых крутятся те самые инструкции, — и понимание, какие из этих ручек вообще что-то решали, отделяет хороший результат онлайн от вывода «инструмент так себе». Всё, что ниже, работает в любом облачном генераторе на диффузии, включая наш.
Почему локальная установка останавливает большинство
Упирается не в навык, а в бюджет на железо:
| Что нужно | Как есть на самом деле |
|---|---|
| Видеопамять, модели поколения SD 1.5 | ~4 ГБ — терпимо, 6 ГБ — комфортно |
| Видеопамять, модели поколения SDXL | 8 ГБ комфортно; 6 ГБ — только с флагами экономии памяти и большим запасом терпения |
| Диск, на каждый чекпоинт | По 2–7 ГБ штука, и одним вы точно не обойдётесь |
| Диск, всё остальное | LoRA по 50–200 МБ каждая, VAE, апскейлеры, сам WebUI |
| Генерация только на процессоре | Минуты на картинку, а не секунды |
| Apple Silicon | Работает, но один портрет — это перерыв на кофе, а не рабочий темп |
Дальше начинаются ошибки, не имеющие никакого отношения к картинкам: несовместимая сборка torch, потерянный VAE, из-за которого каждый результат становится чёрным квадратом, расширение, которое ломает интерфейс после обновления. Любой, кто регулярно генерирует у себя на компьютере, сначала потратил выходные на сантехнику. Нормальный обмен, если вы хотите лабораторию. Плохой — если вы хотите картинку.
Что на самом деле скрывается за «Stable Diffusion онлайн»
Под этой вывеской живут четыре совершенно разные вещи:
| Вариант | Что получаете | В чём подвох |
|---|---|---|
| Ноутбук в облаке (в духе Colab) | Полноценный WebUI на чужой видеокарте | Бесплатные тарифы блокируют популярные WebUI, контент 18+ нарушает правила, сессия умирает — и всё собираете заново |
| Аренда GPU в облаке | Реальный контроль, любой чекпоинт | Оплата по часам — счётчик крутится, пока вы читаете документацию |
| Официальные сервисы и API | Быстро, стабильно, аккуратно | Фильтр по политике: даже намёк на откровенное отклоняется |
| Генератор, сделанный под 18+ | Одно поле для запроса, результат сразу | Ни чекпоинт, ни настройки вы не выбираете |
Если задача — перебрать двадцать чекпоинтов и обучить свою LoRA, арендуйте видеокарту. Если задача — изображения взрослых вымышленных персонажей без выходных, потраченных на настройку, честный ответ — последняя строка. Дальше весь текст оптимизирован именно под неё.
Какие настройки вы теряете и по каким будете скучать
Инструкции помешаны на ползунках. Большинство из них выходит на плато очень быстро. Что каждый реально вам давал:
| Настройка | Что делает | Будете скучать онлайн? |
|---|---|---|
| Steps (шаги) | Проходы шумоподавления. Для большинства моделей плато — 25–35; 80 шагов не «детальнее», просто дольше | Нет |
| CFG scale | Насколько жёстко модель слушается запроса. Слишком низко — размыто и невнятно, слишком высоко — пережжено и перенасыщено | Редко |
| Сэмплер | Способ решения. DPM++ 2M Karras стоит по умолчанию у всех, потому что выигрывает большинство слепых тестов | Нет |
| Разрешение | Современные модели обучены около 1024px. Попросите 512 — получите кашу, попросите 2048 — получите две головы | Нет — сервис сам берёт обученное соотношение сторон |
| Clip skip | Пропускает слой текстового энкодера; заостряет стиль на моделях аниме-линии | Нет |
| Seed | Воспроизводимость: тот же сид плюс тот же запрос — та же картинка | Немного |
| Негативный промпт | Вычитает понятия — единственный по-настоящему полезный рычаг | Да. Вот это настоящая потеря |
Про негативный промпт стоит сказать отдельно. Любой приличный сервис зашивает стандартный негатив за кадром: чистка анатомии и артефактов, которую вы иначе копировали бы с форума, уже включена. Теряется другое — вычитание для конкретной картинки: «в этот раз без очков», «не блондинка».
Компенсируется двумя способами, и оба — это просто более грамотный запрос. Первый: описывайте положительную альтернативу вместо отсутствия. Не «без очков», а «bare face, hair pushed back». Второй: убирайте проблему физически, а не словами. Вместо войны с пальцами через негатив поставьте руки туда, где кадр их вытянет («hands clasped behind her back», «one hand around a wine glass»), или возьмите крупнее, чтобы их вообще не было в кадре.
Как перенести локальный промпт в одно поле
Вот обычный промпт в стиле A1111 — такие копируют со страницы модели:
masterpiece, best quality, ultra detailed, 1girl, solo, (red hair:1.3), green eyes, black dress,
<lora:filmGrain_v2:0.7>, bedroom, night, bokeh Негатив: bad hands, extra fingers, watermark, text, lowres, blurry Steps 30 · DPM++ 2M Karras · CFG 7 · 832x1216 · Clip skip 2
Вставленный в генератор с одним полем, он выдаёт результат хуже ожидаемого — не потому, что облачная модель слабее, а потому что две трети этого текста здесь либо мертвы, либо активно вредят. Перенесённая версия:
cinematic half-body portrait, adult woman with deep red hair and green eyes, black satin dress with thin straps, sitting on the edge of an unmade bed, dim bedroom at night, single warm lamp behind her, fine film grain, shallow depth of field, sharp focus on the eyes
Что изменилось и почему это важно:
1girl, solo→ «adult woman». Booru-теги — родной язык чекпоинтов аниме-линии и почти пустой звук для фотореалистичных. Важнее другое:1girlне задаёт возраст однозначно — всегда прямо пишите, что персонаж взрослый. Размытые формулировки о возрасте приводят к отклонению запроса на любой площадке, а если не приводят — дают размытые лица.(red hair:1.3)→ в начало строки. Синтаксис весов может вообще не разбираться. Слова ближе к началу влияют сильнее, поэтому всё, что вам жалко потерять, должно уместиться в первые десять слов.- Тег LoRA → описание.
<lora:filmGrain_v2:0.7>для облачного пайплайна — просто буквы. Назовите эффект словами — «fine film grain» — и базовая модель его приблизит. - Негатив → позитив. Вместо «bad hands, extra fingers» появилась поза, в которой руки читаются. «watermark, text» уже закрыты зашитым негативом.
- «masterpiece, best quality» → слова про ремесло. Регулятора качества не существует. «Single warm lamp, shallow depth of field, sharp focus on the eyes» меняет картинку; «ultra detailed» в основном нет.
Ещё три привычки, от которых стоит избавиться. Шестьдесят booru-тегов размывают друг друга: внимание модели — ограниченный бюджет, и пятнадцать сильных слов бьют шестьдесят слабых. Мышление в 512×512 закончилось: просите портретный кадр, а если нужно лицо — просите поясной план, потому что лицо на 8% кадра получит 8% детализации. Названия чекпоинтов («juggernaut style, epicrealism») не делают ничего, когда модель выбираете не вы, — описывайте сам вид: «editorial photograph, cool daylight, natural skin texture».
Разбор структуры запроса по блокам подробнее — в гайде по генератору изображений без цензуры. А перед тем как тратить бесплатную попытку, полистайте галерею: разобрать по частям то, что уже сработало, всегда проще, чем писать с нуля.
Когда поле для промпта вам вообще не нужно
Есть сценарий, который локальный Stable Diffusion так и не закрыл: вы не хотите конструировать изображение — вы хотите фото, подходящее к моменту.
В Intimora шесть персонажей, и попросить фото посреди разговора — это совсем другой механизм, чем писать промпт: картинка следует за сценой, в которой вы реально находитесь, а не возвращает случайное селфи. Попросите Валерию, у которой в Милане закрытый клуб и своя галерея, во время позднего показа — и эта обстановка перейдёт в фото. Попросите Аяку, декана кафедры, у неё в кабинете — и получите именно это, а не обобщённый портрет.
Состав такой:
- Аяка, 36 — декан кафедры литературы
- Алекса, 25 — фэшн-модель и владелица собственного бренда
- Наоми, 22 — иллюстратор в жанре фэнтези
- Валерия, 29 — владелица клуба и галереи в Милане
- Сиенна, 27 — наследница поместья
- Goddess, 30 — профессиональная доминатрикс
Как это устроено — в статье ИИ-девушка, которая присылает фото; про разговорную часть — нейросеть для общения 18+; сравнение площадок между собой — лучшие приложения с ИИ-девушкой.
Где проходит граница
Всё здесь — это вымышленные персонажи, созданные по текстовому описанию, только взрослые, и это прямо указывается в запросе.
Нет поля загрузки, нет img2img, нет инпейнтинга по фотографии и нет генерации внешности реального человека. Это не функции, до которых у нас не дошли руки, — это категория, в которой мы не работаем. Любой сервис, который такое рекламирует, продаёт вам юридическую проблему под видом возможности. Создавайте персонажа словами. Результат от этого только выигрывает: описание — это то, с чем модель действительно умеет работать.
FAQ
Браузерный генератор — это правда Stable Diffusion? Облачные генераторы 18+ работают на диффузионных моделях из той же открытой экосистемы, но чекпоинт и сэмплер выбираете не вы: вместо лаборатории вам дают одну заранее настроенную конфигурацию с определённым характером. Если вам нужен именно чекпоинт X при CFG 4.5 — арендуйте GPU, ни один облачный сервис это не повторит.
Можно запустить Stable Diffusion вообще без видеокарты? Локально — да. Генерация на процессоре работает и занимает минуты на картинку, а на Apple Silicon через MPS укладывается в десятки секунд или минуты. Для одной тестовой картинки нормально, для цикла из десяти попыток, который и даёт хороший результат, — мучение.
Нужно ли что-то устанавливать или регистрироваться, чтобы попробовать онлайн? Нет. Гостевой режим на /generate принимает запрос и возвращает изображение — без скачивания, без почты, без карты. Счётчик на странице показывает, сколько бесплатных картинок у вас осталось до того, как что-то попросят взамен.
Почему мой локальный промпт выглядит хуже в облачном генераторе? Почти всегда потому, что в нём остался локальный синтаксис: теги LoRA, скобки с весами, гроздья тегов качества, booru-теги, написанные под другое семейство моделей. Уберите всё это и перепишите обычным описанием: план, персонаж, одежда, обстановка, свет. Переписанная версия обычно выигрывает у исходной.
Можно загрузить референс или использовать img2img? Нет — только текст в изображение. Это осознанное решение, а не незавершённая функция: злоупотребления с реальными людьми происходят именно в сценариях с загрузкой фото, поэтому мы их не предлагаем.
Как работают ограничения по контенту, если модель я сменить не могу? Откровенные запросы про взрослых вымышленных персонажей — это ровно то, ради чего генератор и сделан. Жёсткие границы абсолютны независимо от формулировок: ничего с участием несовершеннолетних и никаких реальных, узнаваемых людей. Всё остальное — ваш запрос и ваша фантазия.