Bir kurulum rehberi buldun. On ikinci dakikada önce "özellikle Python 3.10" dedi, sonra Git istedi, sonra da anonim indirmeleri kasten yavaşlatan bir siteden 6.5 GB'lık bir checkpoint. Kırk dakika sonra konsolda torch.OutOfMemoryError: CUDA out of memory yazdı ve laptopun kapağını kapattın.
Ya da işin dürüst kısmına en baştan atladın: makinende NVIDIA ekran kartı yok. Elinde bir MacBook var, ya da tümleşik grafikli bir iş bilgisayarı — ve her rehber sessizce bunun tersini varsayıyor.
İki yol da aynı soruda bitiyor: bunu doğrudan tarayıcıdan kullanamaz mıyım? Kullanabilirsin. Ama hazır servisler, o rehberlerin saatlerini harcadığı ayarların çoğunu senden geri alıyor. Hangi ayarın gerçekten fark yarattığını bilmek de, online'da iyi sonuç almakla "bu araç kötüymüş" deyip bırakmak arasındaki fark oluyor. Aşağıdaki her şey, bizimki dahil, herhangi bir hazır diffusion üreticisinde geçerli.
Yerel Kurulum Çoğu Kişiyi Neden Yarı Yolda Bırakıyor
Engel yetenek değil, donanım bütçesi:
| Gereken | İşin gerçeği |
|---|---|
| VRAM, SD 1.5 kuşağı modeller | ~4 GB idare eder, 6 GB rahat |
| VRAM, SDXL kuşağı modeller | 8 GB rahat; 6 GB ancak bellek tasarrufu flag'leriyle ve bolca sabırla |
| Disk, checkpoint başına | Tanesi 2–7 GB — ve bir tanesi asla yetmiyor |
| Disk, geri kalan her şey | Tanesi 50–200 MB'lık LoRA'lar, bir VAE, upscaler'lar, WebUI'nin kendisi |
| Sadece CPU ile üretim | Görsel başına saniyeler değil, dakikalar |
| Apple Silicon | Çalışıyor, ama tek bir portre kahve molası demek; deneme-yanılma temposu değil |
Sonra sanatla hiç ilgisi olmayan hatalar başlıyor: uyumsuz bir torch sürümü, eksik bir VAE yüzünden her çıktının siyah kareye dönmesi, güncelleme sonrası arayüzü komple bozan bir eklenti. Kendi bilgisayarında düzenli görsel üreten herkes, önce bir hafta sonunu tesisata harcamıştır. Amacın bir laboratuvar kurmaksa iyi bir takas. Amacın bir görsel almaksa kötü bir takas.
"Stable Diffusion Online" Aslında Ne Demek
Bu etiketi birbirine hiç benzemeyen dört ayrı şey taşıyor:
| Seçenek | Ne elde edersin | Püf noktası |
|---|---|---|
| Notebook (Colab tarzı) | Ödünç alınmış bir GPU üzerinde tam WebUI | Ücretsiz katmanlar popüler WebUI'leri engelliyor, yetişkin kullanım şartları ihlal ediyor, oturum düşünce her şeyi baştan kuruyorsun |
| Kiralık bulut GPU | Gerçek kontrol, istediğin checkpoint | Saatlik faturalanır — sen dokümantasyon okurken sayaç işlemeye devam eder |
| Resmi hazır uygulamalar ve API'ler | Temiz, hızlı, güvenilir | Politika filtresi var; ima düzeyinde prompt'lar bile reddediliyor |
| Yetişkinlere özel üretici | Tek bir prompt kutusu, anında sonuç | Checkpoint'i ve ayarları sen seçmiyorsun |
Amacın yirmi farklı checkpoint denemek ve kendi LoRA'nı eğitmekse, GPU kirala. Amacın bir hafta sonunu kuruluma yatırmadan yetişkin kurgusal karakterlerin görsellerini üretmekse, dürüst cevap son satır — ve bu rehberin geri kalanı tam olarak onu optimize ediyor.
Kaybettiğin Ayarlar ve Gerçekten Özleyeceklerin
Rehberlerin yarısı slider'lara takıntılı. Çoğu aslında çok erken bir noktada doyuma ulaşıyor. Her birinin sana gerçekte ne kazandırdığı:
| Ayar | Ne yapar | Online'da özler misin? |
|---|---|---|
| Steps (adım) | Gürültü temizleme turu sayısı. Çoğu modelde 25–35 arası zaten tavan; 80 "daha detaylı" değil, sadece daha yavaş | Hayır |
| CFG scale | Modelin prompt'a ne kadar sıkı uyacağı. Çok düşükte dağınık ve belirsiz, çok yüksekte yanmış ve aşırı doygun | Nadiren |
| Sampler | Çözücü yolu. Kör testlerin çoğunu kazandığı için herkesin varsayılanı DPM++ 2M Karras | Hayır |
| Çözünürlük | Modern modeller 1024px civarında eğitiliyor. 512 istersen bulamaç, 2048 istersen iki kafa alırsın | Hayır — servis zaten eğitilmiş bir en-boy oranı seçiyor |
| Clip skip | Bir metin kodlayıcı katmanını atlar; anime kökenli modellerde stili keskinleştirir | Hayır |
| Seed | Tekrarlanabilirlik: aynı seed + aynı prompt = aynı görsel | Birazcık |
| Negatif prompt | Kavram çıkarır — gerçekten işe yarayan tek kontrol | Evet. Asıl kayıp bu |
Negatif prompt ayrı bir paragrafı hak ediyor. Düzgün her servis arka planda standart bir negatif prompt gömüyor: forum başlıklarından kopyalayacağın anatomi ve artifact temizliği zaten devrede. Senin kaybettiğin şey görsel bazında çıkarma yapabilmek — "bu sefer gözlük olmasın", "sarışın olmasın" diyebilmek.
Bunu iki şekilde telafi edersin ve ikisi de zaten daha iyi prompt yazmak demek. Birincisi: yokluğu değil, olumlu alternatifi tarif et. "gözlük yok" değil, "bare face, hair pushed back". İkincisi: sorunu sözle değil fizikle çöz. Parmaklarla negatif prompt üzerinden boğuşmak yerine elleri kadrajın kaldırabileceği bir yere koy ("hands clasped behind her back", "one hand around a wine glass") veya kadrajı daraltıp elleri tamamen dışarıda bırak.
Yerel Bir Prompt'u Tek Kutuya Taşımak
İşte model sayfalarından kopyaladığın türden, sıradan bir A1111 prompt'u:
masterpiece, best quality, ultra detailed, 1girl, solo, (red hair:1.3), green eyes, black dress,
<lora:filmGrain_v2:0.7>, bedroom, night, bokeh Negatif: bad hands, extra fingers, watermark, text, lowres, blurry Steps 30 · DPM++ 2M Karras · CFG 7 · 832x1216 · Clip skip 2
Bunu tek alanlı bir üreticiye yapıştırdığında beklenenin altında kalıyor — hazır model daha zayıf olduğu için değil, o metnin üçte ikisi artık ya işlevsiz ya da doğrudan zararlı olduğu için. Taşınmış hâli:
cinematic half-body portrait, adult woman with deep red hair and green eyes, black satin dress with thin straps, sitting on the edge of an unmade bed, dim bedroom at night, single warm lamp behind her, fine film grain, shallow depth of field, sharp focus on the eyes
Neyin neden değiştiği:
1girl, solo→ "adult woman". Booru etiketleri anime kökenli checkpoint'lerin ana dili; fotogerçekçi modellerde neredeyse hiçbir anlam ifade etmiyor. Daha da önemlisi1girlyaş açısından muğlak bir etiket — her zaman açıkça yetişkin yaz. Muğlak yaş ifadeleri her platformda prompt'un reddedilmesine yol açar, reddedilmediğinde de muğlak yüzler üretir.(red hair:1.3)→ öne alma. Ağırlık sözdizimi hiç okunmayabilir. Başa yakın kelimeler daha fazla etki taşıdığı için, kaybetmeye tahammülün olmayan ne varsa ilk on kelimenin içinde olmalı.- LoRA etiketi → tarif.
<lora:filmGrain_v2:0.7>hazır bir servis için sadece düz metin. Etkinin adını yaz — "fine film grain" — temel model onu yaklaşık olarak üretir. - Negatifler → pozitifler. "bad hands, extra fingers" yerine elleri okunabilir tutan bir poz geldi. "watermark, text" zaten gömülü negatifin işi.
- "masterpiece, best quality" → zanaat kelimeleri. Kalite kadranı diye bir şey yok. "Single warm lamp, shallow depth of field, sharp focus on the eyes" görüntüyü gerçekten değiştirir; "ultra detailed" çoğunlukla değiştirmez.
Bırakılması gereken üç alışkanlık daha var. Altmış booru etiketi birbirini sulandırır — dikkat sınırlı bir bütçedir ve on beş güçlü kelime, altmış zayıf kelimeyi döver. 512×512 kafasıyla düşünmek bitti; portre kadrajı iste, yüz istiyorsan yarım boy iste, çünkü kadrajın %8'ini kaplayan bir yüz detayın da %8'ini alır. Checkpoint adı yazmak ("juggernaut style, epicrealism") modeli sen seçmediğinde hiçbir işe yaramaz — onun yerine görünümü tarif et: "editorial photograph, cool daylight, natural skin texture".
Prompt'u Türkçe mi Yazmalı, İngilizce mi?
Bu soru yerelde de aynıydı, online'da da aynı. Görsel modelleri ağırlıklı olarak İngilizce açıklamalarla eğitildiği için İngilizce prompt'lar genelde biraz daha isabetli sonuç veriyor — özellikle ışık, kadraj ve stil kelimelerinde. Ama Türkçe yazamazsın diye bir kural yok; sistem Türkçe tarifleri anlıyor.
Pratikte en iyi çalışan yöntem karışık kullanmak: sahneyi ve karakteri Türkçe kur, teknik sözlüğü İngilizce bırak. "Yarım boy portre, koyu kızıl saçlı yetişkin bir kadın, loş yatak odası" + "cinematic lighting, shallow depth of field, sharp focus on the eyes" gibi. Zaten yukarıdaki listede gördüğün kelimeler — "half-body portrait", "warm lamp", "film grain" — sektörün ortak dili; Türk kullanıcılar da bunları çevirmeden kullanıyor, çünkü model onları o hâliyle daha net tanıyor.
Blok blok tam yapı için NSFW yapay zeka görsel üretici rehberimiz daha derine iniyor. Ücretsiz hakkını harcamadan önce galeriye bir göz atmak da mantıklı — çalıştığı belli olan bir şeyi tersine mühendislikle çözmek, sıfırdan yazmaktan her zaman kolaydır.
Prompt Kutusu İstemediğin Durum
Yerel Stable Diffusion'ın hiçbir zaman düzgün çözemediği tek bir senaryo var: bir görseli kurgulamak istemiyorsun, o ana yakışan bir fotoğraf istiyorsun.
Intimora'da altı karakter var ve sohbetin ortasında birinden fotoğraf istemek, prompt yazmaktan tamamen farklı bir mekanizma: görsel, rastgele bir selfie döndürmek yerine gerçekten içinde bulunduğun sahneyi takip ediyor. Milano'da üyelik usulü bir kulüp ve sanat galerisi işleten Valeria'dan gece geç saatteki bir özel gösterim sırasında iste — o mekân fotoğrafa taşınır. Üniversite dekanı Ayaka'dan kendi ofisindeyken iste — jenerik bir portre yerine tam olarak onu alırsın.
Kadro şöyle:
- Ayaka, 36 — edebiyat bölümü dekanı
- Alexa, 25 — moda modeli ve kendi markasının sahibi
- Naomi, 22 — fantezi illüstratörü
- Valeria, 29 — Milano'da kulüp ve galeri sahibi
- Sienna, 27 — bir malikânenin vârisi
- Goddess, 30 — profesyonel dominatrix
Bu mekanizmanın nasıl çalıştığı fotoğraf gönderen yapay zeka sevgili yazısında, sohbet tarafı NSFW yapay zeka sohbet yazısında, platform karşılaştırmaları da en iyi yapay zeka sevgili uygulamaları yazısında anlatılıyor.
Sınır Nerede
Buradaki her şey metin tariflerinden üretilen kurgusal karakterlerden ibaret, sadece yetişkinler, ve bu prompt'ta açıkça belirtiliyor.
Yükleme alanı yok, img2img yok, bir fotoğraf üzerinde inpainting yok, gerçek bir kişinin benzerliğini üretme yok. Bunlar "henüz yapmadığımız özellikler" değil — hiç bulunmadığımız bir kategori. Bunu reklam olarak sunan her araç, sana bir hukuki problemi özellik kılığında satıyor. Karakteri kelimelerle var et. Çıktı zaten böyle daha iyi oluyor, çünkü modelin üzerinde işlem yapabileceği şey tarifin kendisi.
FAQ
Tarayıcıdan çalışan bir üretici gerçekten Stable Diffusion mı? Hazır yetişkin üreticileri aynı açık ekosistemden gelen diffusion modellerini çalıştırıyor, ama checkpoint'i ve sampler'ı sen seçmiyorsun — bir laboratuvar yerine önceden ayarlanmış, fikri belli tek bir konfigürasyon alıyorsun. Özellikle "X checkpoint'i, CFG 4.5" gibi bir ihtiyacın varsa GPU kirala; hiçbir hazır servis bunu birebir karşılamaz.
Hiç ekran kartım yokken Stable Diffusion çalıştırabilir miyim? Yerelde evet — sadece CPU ile çalışır ve görsel başına dakikalar sürer; Apple Silicon'da MPS üzerinden on saniyelerle dakikalar arasına oturur. İkisi de tek bir test görseli için idare eder, ama iyi sonucu asıl üreten "on deneme" döngüsü için işkenceye dönüşür.
Online denemek için bir şey kurmam veya üye olmam gerekiyor mu? Hayır. /generate sayfasındaki misafir modu prompt'unu alır ve görselini döndürür; indirme yok, e-posta yok, kart yok. Sayfadaki sayaç, senden herhangi bir şey istenmeden önce kaç ücretsiz görsel hakkın kaldığını gösterir.
Yerelde iyi çalışan prompt'um neden hazır üreticide kötü sonuç veriyor? Neredeyse her zaman içinde hâlâ yerel sözdizimi taşıdığı için: LoRA etiketleri, ağırlık parantezleri, kalite etiketi yığını, başka bir model ailesine yazılmış booru etiketleri. Hepsini temizle ve düz tarif olarak yeniden yaz: çekim, özne, kıyafet, mekân, ışık. Yeniden yazılmış hâli genellikle orijinalinden iyi çıkar.
Referans görsel yükleyebilir veya img2img kullanabilir miyim? Hayır — sadece metinden görsel. Bu eksiklik değil, bilinçli bir tercih: gerçek kişilerin kötüye kullanımı tam olarak fotoğraf yükleme akışlarında yaşanıyor, o yüzden bu akışları hiç sunmuyoruz.
Modeli kendim değiştiremiyorsam içerik sınırları nasıl işliyor? Yetişkin kurgusal karakterleri anlatan açık prompt'lar zaten üreticinin var oluş sebebi. Katı sınırlar ise nasıl ifade edersen et mutlak: reşit olmayanlarla ilgili hiçbir şey ve gerçek, tanınabilir kişiler yok. Bunların dışında kalan her şey senin yazacağın prompt.