Seedance 2.0 promptlarınız neden sürekli işaretleniyor (ve ne yapmalı)

Fikre zaman harcadınız, referans görsellerinizi yüklediniz, sahneyi baştan sona yazdınız. Sonra üretim işaretlendi. Ya da tarif ettiğinizle hiç alakası olmayan bir sonuç geldi. Bir iki kelimeyi değiştirip yeniden denediniz ve aynı duvara tosladınız.

Seedance 2.0'ın girdi sistemini anlamak

Her şeyden önce, Seedance 2.0'ın tam olarak neyi kabul ettiğini ve çoğu kullanıcının daha bir prompt yazmadan nerede yanlış yaptığını bilmek işinize yarar.

  • Görseller: En fazla 9 adet. Açılış karesi, karakter referansı, sahne ortamı veya stil çıpası olarak kullanılır.
  • Video klipler: En fazla 3 klip, toplam süre 15 saniyeyi geçmemek üzere. Kamera hareketlerini referans almak, hareketi taklit etmek ya da uzatılacak veya düzenlenecek kaynak görüntü olarak kullanılır.
  • Ses dosyaları: En fazla 3 dosya, toplam süre 15 saniyeyi geçmemek üzere. Fon müziği, ses tasarımı veya bir seslendirme tonu referansı olarak kullanılır.
  • Metin: Promptunuz, doğal dilde.

Girdi türleri arasında ortak bir dosya üst sınırı yoktur, dolayısıyla dokuz görsel eklemenizin önünde bir engel bulunmaz. Asıl mesele öz denetim: ByteDance toplamda 4 ila 5 varlık öneriyor ve kotanın tamamını kullanmanın modelin hangi özelliklerin önemli olduğunu ayırt etmesini zorlaştırdığı, bunun da stil çakışmalarına ve bulanık özne tanımasına yol açtığı konusunda uyarıyor. Önce sesi ve ikincil görsel referansları geri plana atın, çünkü bunlar kelimelerle en kolay tarif edilebilecek şeylerdir. Yüklemeleri gerçekten yazıya dökülemeyecek şeyler için saklayın: belirli bir yüz, tam olarak istenen bir kamera hareketi, özel bir koreografi.

İnsanları yanıltan iki sınır: her referans klip (video veya ses) en az 2 saniye uzunluğunda olmalıdır ve metin ile ses tek başına üretim yapmaz. Sesin yanında her zaman görsel bir referans gerekir.

[Referans] Doğru başlangıç noktasını seçmek

  • İlk ve son kare: Tek görsel artı metin üretimleri için kullanın. Basit çekimler için sade ve hızlıdır.
  • All-in-One Reference: Görsel, video ve sesin herhangi bir kombinasyonu için gereklidir. @ etiketiyle referans vermenin çalıştığı tek mod budur. Girdi türlerini birbirine karıştırıyorsanız ihtiyacınız olan mod budur.

Not: Smart Multi-Frame ve Subject Reference şu anda Seedance 2.0'da mevcut değildir.


Promptunuzun işaretlenmesinin asıl nedeni

Çoğu kişi işaretlenen promptların bir filtreyi tetikleyen belirli bir kelime ya da ifade içerdiğini varsayar. Bu varsayım, kelimeleri değiştirmek, uyarı notları eklemek veya promptu iyice budamaktan ibaret sonu gelmez bir döngüye götürür. Hiçbiri de sorunu gerçekten çözmez.

Seedance 2.0'ın içerik filtresi bu şekilde çalışmaz. Promptunuzun tamamını tek bir sahne olarak okuyan ve bu sahnenin neyi temsil ettiğine dair bir yargıya varan bir dil modeli kullanır. Tek tek terimleri taramaz; niyeti ve bağlamı değerlendirir.

Bunu bir film stüdyosundaki güvenlik görevlisiyle bir bankadaki güvenlik görevlisi arasındaki fark gibi düşünün. Aynı sahte silah stüdyo kapısından hiç sorgusuz geçer, çünkü bağlam amacı apaçık ortaya koyar. Bankada ise durum tamamen değişir. Nesne değişmedi. Değişen, bağlam.

Bunun pratikteki anlamı şu: tek başına hassas görünen bir kelime, iyi kurulmuş sinematik bir promptun içinde hiçbir sorun çıkarmadan durabilir. Filtre bütün resmi okur. Okunacak resmi olmayan, mekânı, görsel amacı, anlatısal mantığı bulunmayan bir prompt ona tutunacak hiçbir şey vermez. Filtre ne üretildiğini güvenle yorumlayamadığında ihtiyatlı davranmayı seçer.

İşaretlenmemesi gereken hemen hemen her işaretli promptun özü budur. Kötü içerik değil. Kötü fikir değil. Sadece filtreye anlaması için yeterince şey vermeyen bir prompt.

Pratik değişim şu: bir çekimi tarif eden bir yönetmen gibi okunan bir prompt genelde geçer. Bir arkadaşa yazılmış not gibi okunan bir prompt genelde işaretlenir.

Bir kategori düzeltilebilir bir işaret değil, kesin bir engeldir. İki tür içerik, prompt daha okunmadan görsel tarama aşamasında reddedilir ve ne kadar sinematik bir çerçeveleme olursa olsun bunları geçirmez:

  • Tanınabilir kişilerin gerçek yüzleri: ünlüler, siyasetçiler ve kamuya mal olmuş kişiler
  • İsimli, telifli karakterler: markalı süper kahramanlar, Disney karakterleri, tanınabilir kurgusal fikri mülkiyet

Üretiminiz gerçek bir kişinin yüklenmiş fotoğrafında başarısız oluyorsa, bu bir prompt sorunu değil, platform düzeyinde bir kısıtlamadır.


Filtrenin açıkça yaratıcı olarak okuyacağı promptlar nasıl yazılır

[Filtre] Yalnızca eylemi değil, tüm sahneyi çerçeveleyin

İşaretlenen promptlarda en sık görülen yapı, çevresinde hiçbir bağlam olmayan tek bir eylemdir. Bir şey olur, ama ne bir mekân, ne görsel bir atmosfer, ne de kameranın orada olması için bir neden vardır. Filtre bunun bir film seti mi yoksa başka bir şey mi olduğunu anlayamaz.

Çözüm eylemi çıkarmak değildir. Niyet kendiliğinden belli olana kadar sahneyi eylemin etrafında kurmaktır.

Bundan kaçınınBunun yerine bunu kullanın
bir asker sokakta birini vuruyorgeniş çekim, 1940ların savaşta harabeye dönmüş bir Doğu Avrupa sokağı, gri üniformalı bir asker devam eden bir çatışma sırasında kadraj dışındaki bir konuma ateş ediyor, arka planda yıkılmış binalardan yükselen dumanlar, kapalı havanın düz ışığı, 35mm grenli doku, belgesel tarzı elde kamera çerçevelemesi, ön planda dağılmış enkaz

Eylem birebir aynı. Birincisi filtreye değerlendirecek tek bir şey verir. İkincisi ona bir savaş bağlamı, tarihsel bir dönem, bir kamera konumu ve eksiksiz bir görsel atmosfer verir. Biri bir rapor gibi okunur. Öteki bir çekim brifingi gibi.

Eylemden dışarıya doğru kurun ve promptunuzda şu dört soruyu yanıtlayın:

  • Bu nerede oluyor?
  • Görsel olarak neye benziyor?
  • Kamera ne yapıyor?
  • Genel atmosfer nasıl?

Dördünü de yanıtlayın, işaretlenme sorunlarının çoğu kendiliğinden çözülür.


[Prompt] Promptunuzu bir hikâye değil, bir dizi görsel olgu olarak ele alın

İşaretlenmenin daha az bariz nedenlerinden biri, görsel yerine duygusal ya da anlatısal okunan prompt metnidir. Şu ögeler, modelin baş etmek zorunda kaldığı yorumsal bir gürültü katar:

  • Karakter motivasyonları
  • Dramatik geçmiş
  • İlişki bağlamı
  • Duygusal açıklamalar

Filtre, bu sahne var olsaydı kameranın ne göreceğiyle ilgilenir. Nedenini bilmesine gerek yoktur.

Bir senaryonun iki katmanı vardır: sahne betimlemesi ve alt metin. Seedance 2.0'ın yalnızca sahne betimlemesine ihtiyacı vardır. Duygusal alt akıntı, geçmiş öykü, karakterin neden koştuğu: işte bu alt metindir. Yazarın kafasında yeri vardır, promptta değil.

Herhangi bir cümleyi promptunuza eklemeden önce tek bir soru sorun: gerçek bir film çekiminde bu cümle çekim listesinde yer alır mıydı? Yer almazdı ise büyük olasılıkla promptta da yeri yoktur.

Bu disiplin üretim kalitesini de belirgin biçimde iyileştirir. Model çıkarım yapabildiğini değil, görebildiğini uygular. Yoğun, spesifik, görsel promptlar uzun ve anlatısal olanları neredeyse her seferinde geride bırakır.

Çok çekimli diziler için prompta bir yapı verin. ByteDance'in önerdiği biçim, sade düzyazıyla çekim çekim bir hikâye panosudur: görsel kaydı bir kez belirleyin, ardından her çekimi sırayla kamera hareketi, öznenin eylemi, konum, ses olarak ele alın.

Görsel kayıt (baştan sona geçerli): yumuşak kapalı hava ışığı, dağılmış gölgeler, keskin
kenar yok. Soluk doğal tonlar, soğuk beyazlar, doygunluğu düşürülmüş renkler. 35mm gren,
anamorfik lens, parlak alanlarda yumuşak halasyon. Sessiz, ıssız, engin.

Çekim 1: Sabit geniş çekim, alçak açı. Yalnız bir atlı bir kar tarlasının sırtına ulaşıyor.
Çekim 2: Arkadan takip çekimi, elde kamera hissi. At ve binici derin karda dörtnala gidiyor,
        binicinin pelerini rüzgârda dalgalanıyor.
Çekim 3: Sabit geniş, tamamen kilitli. Boş bir kar tarlası. Uzaktaki bir sırtta kımıldamadan
        duran bir kurt.

Altyazısız olsun. Filigran üretme.

Görsel kaydı baştan bir kez belirlemek, tüm dizinin sinematik tonunu oturtur. Her çekimin de yalnızca kameranın o anda ne gördüğünü betimlemesi yeterli olur.

Her çekime bir süre atamayın. Her sahnenin karşısına "duration": "3 seconds" yazmak cazip gelir ve kendi çıktınızı bozmanın en yaygın yoludur. Seedance kesin zamanlamayı dengesiz şekilde ele alır; segmentleri sabit saniye sayılarına sabitlemek üretimi sıkılaştırmak yerine bozabilir. Çekimleri sıralayın ve ritmi modelin bulmasına bırakın.


[Prompt] Bunun ne tür bir içerik olduğunu belirlemek için prodüksiyon dili kullanın

Bilinmeye değer güvenilir bir örüntü var: film prodüksiyonunun kelime dağarcığını içeren promptlar, sade dille yazılanlara kıyasla belirgin biçimde daha geniş bir hoşgörüyle değerlendirilir.

Nedeni basit. Bir prompt çekim türleri, lens özellikleri, ışık kurulumları ve en-boy oranları içerdiğinde, model bunu bir prodüksiyon brifingi olarak yorumlar. Film prodüksiyonlarının dramatik, yoğun ve ahlaki açıdan karmaşık malzeme göstermesine izin verilir. Bu bağlam, filtrenin içeriği nasıl tarttığını değiştirir.

Bu biraz şantiyede baret takmaya benzer. Baret ne yaptığınızı değiştirmez, ama çevredeki herkese anında bunun ne tür bir ortam olduğunu ve kuralların ne olduğunu bildirir. Bir promptta iki üç prodüksiyon terimi aynısını yapar: filtre başka bir şeyi değerlendirmeden önce kaydı belirler.

Bu, her promptu teknik jargona boğmak demek değildir. Çerçevelemenin belirsizliğe yer bırakmayacağı kadar prodüksiyon dili katmak demektir. İşte kategorilere göre düzenlenmiş bir başvuru listesi:

Çekim türleri

  • Geniş çekim, orta çekim, yakın çekim, aşırı yakın çekim
  • Omuz üstü, POV, kuşbakışı, ikili çekim
  • Alçak açı, yüksek açı, eğik açı

Kamera hareketleri

  • İleri dolly / geri dolly
  • Takip çekimi, pan, tilt, vinç çekimi
  • Kilitli sabit, alçak açıdan itiş, çevreleyen çekim, elde kamera

Lens ve format

  • 35mm gren, anamorfik lens, 2.39:1 en-boy oranı, 1.85:1
  • Eski lensler, yumuşak halasyon, sığ alan derinliği
  • Lens parlaması, netlik kaydırma

Bunlar görünüm için betimleyici terimlerdir, çıktı ayarları değil. Prompta "2.39:1" yazmak modele ne tür bir görüntü istediğinizi söyler; ayarlarınızda gerçekten seçtiğiniz oran ise Seedance'in verdiği en yakın scope formatı olan 21:9'dur.

Işık

  • Kapalı hava dağınık ışığı, pusun içinden geçen hacimsel ışınlar
  • Kadraj içi pratik ışıklar, yan kontra ışık, motive edilmiş gölge
  • Altın saat, sert yönlü ışık, kenar ışığı

Renk ve ton

  • Soluk, doygunluğu düşürülmüş palet, yüksek kontrast, bleach bypass
  • Soğuk mavi tonlar, sıcak kehribar, ezilmiş siyahlar
  • Yıkanmış parlak alanlar, düz, düşük kontrastlı renklendirme

Bu kategorilerin herhangi birinden bir promta iki üç terim eklemek prodüksiyon bağlamını net biçimde oturtur. Çoğu zaman gereken bu kadardır.


Promptunuz hiç hassas içerik olmasa bile neden işaretleniyor

Bazen bir üretim işaretlenir ve promptta uzaktan yakından hassas hiçbir şey yoktur. Ne bir eylem, ne dram, ne de zor bir konu. Sadece tamamen sorunsuz olması gereken bir sahne.

Bu, prompt fazla seyrek olduğunda olur. Herhangi bir sinematik çerçeveleme, sahne bağlamı ya da görsel belirginlik içermeyen kısa, sade bir betimleme filtreye eksik bir resim verir. Bu, birine bir senaryonun ortasından tek bir cümleyi, başlık sayfası, sahne başlığı ve sahne yönergesi olmadan göndermeye benzer. O kişi bunun bir gerilim mi, komedi mi, yoksa büsbütün başka bir şey mi olduğunu anlayamaz. Eksik resimler onaylanmaz, bekletilir.

Bundan kaçınınBunun yerine bunu kullanın
bir kişi bıçak tutuyoryakın çekim, bir aşçının elleri ahşap bir doğrama tahtası üzerinde bir satırı kavrıyor, bıçak bir bütün balığın üzerine inerken hareket bulanıklığı, arka planda buhar yükselen mutfak ortamı, sıcak tungsten aydınlatma, sığ alan derinliği, sinematik yemek belgeseli tarzı

Aynı nesne, tamamen farklı bir okuma. Birincisi filtreye bir nesne ve bir eylem verir. İkincisi ona bir ortam, bir amaç, bir prodüksiyon bağlamı ve bir kamera betimlemesi verir.

Çözüm basit. Basit bir sahne bile şu eklemelerden fayda görür:

  • Belirli bir mekân ve zaman dilimi
  • Bir atmosfer veya ruh hali tanımlayıcısı
  • Bir kamera konumu ya da çekim türü
  • Bağlamı oturtmak için bir iki prodüksiyon dili terimi

@ referans sistemi: yüklemeler neden sessizce başarısız olur

Seedance 2.0 sorunlarının önemli bir kısmı aslında hiç filtre sorunu değildir. Referans sorunlarıdır. Kullanıcılar görsel ve video klip yükler, modelin her dosyanın ne işe yaradığını anlamasını bekler; oysa model hiçbir varsayımda bulunmaz.

Bir video yüklemek onu bir kamera referansı yapmaz. Bir görsel yüklemek onu açılış karesi yapmaz. Bunu bir yönetmene sette etiketsiz bir tomar fotoğraf uzatmak gibi düşünün. Her karede ne olduğunu görebilir, ama hangisini açılış karesi istediğinizi, hangisinin bir kostüm referansı, hangisinin sadece arka plan ilhamı olduğunu bilemez. Etiket olmadan tahmin yürütür. Seedance 2.0 da farklı değildir. Yüklenen her dosyanın promptta @ etiketleriyle açıkça belirtilmiş bir rolü olmalı, aksi halde belirsiz biçimde işlenir.

@ etiketlemeyi, prompt alanına @ yazarak (bir referans seçici belirir) ya da araç çubuğundaki @ simgesine tıklayarak etkinleştirin. Ardından eylemi betimlemeden önce her dosyanın tam olarak ne işe yaradığını belirtin.

Ne istiyorsunuzNasıl yazılır
Açılış karesini belirle@Image 1 as the first frame
Kamera hareketini referans alreference all camera movements from @Video 1
Karakter görünümünü eşleştircharacter appearance based on @Image 2
Fon müziğini belirleuse @Audio 1 as the background score
Hareket koreografisini taklit etreplicate the movement style from @Video 1
Ortamı tanımlathe setting is based on @Image 3
Seslendirme tarzını referans almatch the voiceover tone of @Video 2

Birden fazla referansla çalışırken, tüm rol atamalarını herhangi bir sahne betimlemesinden önce promptun en üstünde sıralayın. Açık bir rolü olmayan herhangi bir @ etiketi, tutarsız veya beklenmedik çıktının en güvenilir nedenlerinden biridir.


Seedance 2.0 görsel yüklemelerini nasıl okur (ve nerede tıkanır)

[Görsel] Bir karakter görseli yüklediğinizde bırakın işi o yapsın

Bir karakter referans görseli yüklerken o karakteri promptta da betimlemek doğal bir eğilimdir. Direnin. Görsel bu işi zaten yaptı. Metinde tekrar etmek çıktıyı pekiştirmez. Modelin bağdaştırmak zorunda kaldığı ikinci, rakip bir bilgi katmanı ekler.

Promptun yapması gereken şey sahneyi net biçimde betimlemektir:

  • Çekimde ne olduğu
  • Kameranın nasıl konumlandığı
  • Ortamın neye benzediği
  • Çekimin nasıl hareket ettiği

Görünümü görsel üstlenir. Kameranın gördüğü her şeyi prompt üstlenir.

İşaretlenmenin bir görsel sorununa dönüştüğü yer de burasıdır. Seedance 2.0, bir karakterin reşit olmayan biri olarak okunması muhtemel her promptu daha katı biçimde değerlendirir. Gençliğe işaret eden kelimeler ("çocuk", "ufaklık", "genç", "oğlan", "kız"), yalnızca geçtikleri ifadede değil, promptun tamamında ve yüklenen görselin ne gösterdiğine bakılmaksızın artırılmış bir incelemeyi tetikler.

Daha temiz yaklaşım, karakterleri sahnedeki rolleriyle betimlemektir. Kim oldukları hakkındaki her şeyi görsel üstlenir. Ne olduğunu ve kameranın ne gördüğünü prompt üstlenir.

Bundan kaçınınBunun yerine bunu kullanın
genç bir oğlan bir binanın yanışını izliyorkoyu paltolu küçük bir figür bir kalabalığın kıyısında durmuş alevlere teslim olan bir binayı izliyor, arkadan orta çekim, alevlerin sıcak turuncu parıltısı, karanlık bir gökyüzüne yükselen yoğun duman, sinematik, 2.39:1 anamorfik, belgesel tarzı

Birinci versiyondaki "genç" kelimesi promptun tamamı için hassasiyet eşiğini yükseltir. İkinci versiyon karakterin kimliğini yüklenen görselin taşımasına izin verir. Prompt yalnızca kameranın gördüğünü betimler.


[Görsel] Daha göndermeden işaretlendiniz mi? Sorun görselin kendisi

Seedance 2.0'da prompt filtresinden bağımsız çalışan bir görsel değerlendirme katmanı vardır. Yüklenen bir görsel açıkça görünür bir yüz içeriyorsa, model herhangi bir metni işlemeden önce bir reddi tetikleyebilir. Promptu tekrar tekrar yeniden yazmanın hiçbir fark yaratmadığı örüntüyü bu açıklar. Prompt zaten okunmuyor.

Bunu aşmanın yolu:

  • Yüzü kameradan uzağa çevirin. Özneyi arkadan ya da yüz hatlarının görünmediği bir açıdan çerçeveleyin. Çoğu referans amacı için kıyafet, duruş, saç ve ortam yeterli bilgi taşır.
  • Genişletin. Çekimi, figürün baskın özne yerine bir siluet ya da kadraj içinde küçük bir öge gibi okunacağı kadar geniş tutun.
  • Fotoğraf yerine illüstrasyon kullanın. Fotoğrafik referansları illüstre veya stilize olanlarla değiştirin. Değerlendirme orada farklı işler ve illüstre görseller daha güvenilir biçimde geçer.
  • Referans amacını kaydırın. Görseli yüz ya da kimlik için değil; kıyafet, mekân, renk paleti veya mekânsal kompozisyon için kullanın.

Bir üretim, prompt tarafında net bir açıklama olmadan sürekli başarısız oluyorsa, metni yeniden yazmadan önce görseli düzenleyin.


Bilinmeye değer ileri teknikler

[İleri] Mevcut görüntüyü uzatmak

Hangi yönü istediğinizi söyleyin, ardından yeni segmentin ne içerdiğini betimleyin. Uzatma iki yönlü çalışır: bir klipten sonra ne olduğunu da, ondan önce ne olduğunu da üretebilirsiniz.

Generate the content after @Video 1. [Yeni segmentin betimlemesi.]

Extend @Video 1 backward. [Ona hangi şeyin götürdüğünün betimlemesi.]

Burada "reference @Video 1" yazmayın. Bu bir referans görevi değil, bir düzenleme görevidir; reference kelimesi modeli bunu bir referans görevi olarak sınıflandırmaya iter, dolayısıyla klibinizi sürdürmek yerine ona yalnızca benzeyen yeni bir video üretir. Klibe sadece @Video 1 olarak sade biçimde atıfta bulunun.

Özgün görüntü yeniden üretilmez, dolayısıyla zaten beğendiğiniz kısım dokunulmadan kalır. Etrafında plan yapmanız gereken iki şey: birleşim noktasında küçük bir sıçrama görünebilir (bunu düzenleyicinizde, çıkan klibin sonundan yaklaşık altı kare, giren klibin başından da bir kare kırparak giderin) ve uzatmaları arka arkaya zincirlediğinizde kalite bozulur, bu da ilk olarak yüzlerde benekli renklenme olarak belirir. Zincirleri kısa tutun.


[İleri] İki klibi üretilmiş bir ara bölümle köprülemek

Generate a connecting scene between @Video 1 and @Video 2. The transition shows [iki klibi birbirine bağlayan eylemi, ortamı ya da hareketi betimleyin].

Üretilen segment yüklenen iki klibin arasına yerleştirilir; bu yüzden onu kendi başına kısa bir sahneymiş gibi betimleyin.


[İleri] Bir referans klipten kamera stilini kopyalamak

İstediğiniz hareket stiline sahip herhangi bir klibi yükleyin ve doğrudan adlandırın:

Reference all camera movements from @Video 1, including the low-angle circling shot and the push into close-up.

Buradaki "reference" kelimesi doğru, çünkü bu gerçekten bir referans görevidir: bir kamera stilini ödünç alan yeni bir video yapıyorsunuz. Kelimeyi yalnızca yüklenen klibin kendisini düzenlerken veya uzatırken çıkarın.

Model referans klipten hareket ritmini, kadraj mantığını ve geçiş temposunu çeker. Kesin teknik adları yardımcı olur ama zorunlu değildir. Yine de her çekimi tek bir kamera hareketiyle sınırlayın: bir itiş, bir yörünge ve bir pan'i tek bir çekime yığmak, görüntüyü istikrarsızlaştırmanın güvenilir bir yoludur.


[İleri] Kurguları müziğe senkronlamak

(Rhythm and tempo from @Audio 1.) Scene transitions land on the beat. Apply the visual style change at each cut.

Seedance 2.0 kesmeleri, ışık değişimlerini ve sahne geçişlerini yüklenen bir ses parçasının ritmine senkronlayabilir. Senkronu saniyelerle değil, vuruşlarla betimleyin. Modelin kesin zaman kodlarını ("6. saniyede kes") ele alışı dengesizdir; olayları tam saniye sayılarına sabitlemek çıktıyı sıkılaştırmak yerine bozabilir. Her kesmeyi kendi çekimi olarak yazın ve zamanlamayı vuruş taşısın.


[İleri] Mevcut bir video klipteki sesi kullanmak

Zaten referans aldığınız klipte istediğiniz ses varsa, ayrı bir ses yüklemesine gerek yoktur:

Use the audio embedded in @Video 1 as the background score.


[İleri] Kısıt kelimeleri: kimsenin istemediği artefaktları elemek

İçerik filtresinden ayrı olarak, üretimin başarılı olduğu ama çıktının hiç istemediğiniz bir şey içerdiği bir başarısızlık sınıfı vardır: kadraja gömülü altyazılar, başıboş bir logo, başka bir platformun filigranı. ByteDance'in kendi rehberi, promptu açık kısıt cümleleriyle kapatmayı önerir:

Keep it subtitle-free. Avoid generating any text or subtitles.

Do not generate a logo. Do not generate a watermark.

The character's face stays consistent with no deformation. Motion is smooth, with no stutter or flicker.

Bunun size ne kazandırdığı konusunda gerçekçi olun. Kısıt satırları başıboş altyazı ve filigran olasılığını azaltır. Ortadan kaldırmaz. İki şey kelimelerden daha fazla yardımcı olur:

  • Yüklemeden önce referans varlıklarınızdaki metni ayıklayın. Bir referans görselinde ya da klibinde ihtiyacınız olmayan bir metin varsa, önce çıkarın. Girdideki metin, çıktıda metin elde etmenin en güvenilir yoludur.
  • Yapabiliyorsanız yatay üretin. Başıboş altyazılar yatayda dikeye kıyasla belirgin biçimde daha seyrek görünür. Nihai eser dikeyse, çoğu zaman 16:9 üretip sonradan kırpmaya değer.

Kısıtları kısa tutun ve gerçekten gördüğünüz hataya bağlayın. Olabilecek her şeyin uzun, genel bir listesi seyreltilir ya da göz ardı edilme eğilimindedir.


[Topluluk] İnsanların üzerinde deney yaptığı bir şey

Bazı kullanıcılar sahne betimlemesini Çince yazıp diyalog ya da ekran üstü metni İngilizce tutarak daha iyi geçiş oranları bildirdi. Gerekçe şu: Seedance 2.0 başlangıçta güçlü bir Çince dil eğitimiyle geliştirildi, dolayısıyla Çince yazılan promptlar biraz farklı filtre eşikleriyle yorumlanabilir.

Bu garantili bir çözüm değil ve sonuçlar değişkenlik gösterir, ama iyi kurulmuş bir prompt sağlam sinematik çerçevelemeye rağmen sürekli işaretleniyorsa, denemesi zahmetsiz bir şeydir. Sahne betimlemenizi herhangi bir çeviriciden geçirin, diyalog satırlarını İngilizce tutun ve çıktının farklı olup olmadığına bakın.

Buna karşı tartmanız gereken, belgelenmiş bir bedel var. ByteDance'in rehberi, özel adlar dışında bir promptta Çince ile İngilizceyi karıştırmaktan kaçınılması ve özellikle diyalog dilinin tutarlı kalması gerektiği konusunda nettir. Yani İngilizce diyaloglu bir Çince sahne betimlemesi tam da model sahibinin uyardığı karışımdır ve bedeli çoğunlukla konuşulan satırlarda bozuk telaffuz olarak ortaya çıkar. Videonuzda diyalog yoksa risk düşüktür. Varsa, buna güvenmeden önce test edin.


Girdi limitleri bir bakışta

Girdi türüLimit
GörsellerEn fazla 9. JPEG, PNG, WEBP, BMP, TIFF, GIF, HEIC, HEIF. Her biri en fazla 30MB
Video kliplerEn fazla 3. Her biri 2-15 sn, toplam 15 sn. MP4/MOV, 24-60fps, her biri en fazla 200MB
Ses dosyalarıEn fazla 3. Her biri 2-15 sn, toplam 15 sn. MP3/WAV, her biri en fazla 15MB
Tüm dosyalar birlikteOrtak bir üst sınır yok. Ama toplamda 4-5 varlık önerilen aralık
DesteklenmiyorGörsel olmadan metin + ses, ya da tek başına ses
Üretim süresi4 ila 15 saniye

Üretmeden önce: kısa bir kontrol listesi

  • All-in-One Reference modunu mu kullanıyorum? (Girdi türlerini karıştırdığınız her durumda gerekli)
  • Her @ etiketinin promptta açıkça belirtilmiş bir rolü var mı?
  • Prompt bir anlatı ya da geçmiş öykü değil, görsel bir sahne mi betimliyor?
  • En az bir prodüksiyon dili ögesi ekledim mi: bir çekim türü, kamera hareketi veya ışık betimlemesi?
  • Her cümle kameranın ne gördüğünü betimliyor ya da sinematik bir bağlam mı kuruyor?
  • Prompt karakterlere yaşları yerine rolleriyle mi atıfta bulunuyor?
  • Referans görselim belirgin yüzlerden arınmış mı, yoksa kırpılmış ya da illüstre mi?
  • Referans görselim gerçek, tanınabilir kişilerden ve isimli telifli karakterlerden arınmış mı?
  • Çekimin gerçekten ihtiyaç duyduğu kadar az referans mı kullanıyorum? (4 ila 5 önerilen aralık; ortak bir üst sınır yok ama kotanın tamamını kullanmak sonuçları bozar)
  • Çekimlerim zaman damgalı değil, sıralı mı (Çekim 1, Çekim 2)?
  • Promptu kısıtlarla mı kapattım? ("Keep it subtitle-free. Do not generate a watermark.")

SSS

Promptumda hassas hiçbir şey yok ama yine de işaretlendi. Neden?

Filtrenin, ne üretildiğini güvenle yorumlayabilmek için yeterli görsel bağlama ihtiyacı var. Sinematik çerçeveleme ya da sahne detayı olmayan kısa, sade promptlar ona eksik bir resim verir, o da ihtiyatlı davranır. Mekân, atmosfer, kamera konumu ve prodüksiyon bağlamına dair bir his eklemek bunu genelde çözer.

Promptumu sürekli yeniden yazıyorum ama üretim başarısız olmaya devam ediyor. Başka ne olabilir?

Prompt üzerindeki değişiklikler bir fark yaratmıyorsa sorun büyük olasılıkla görseldir. Seedance 2.0 yüklemelerde, prompt filtresi devreye girmeden önce yüz algılama çalıştırır. Bir referans görselinde yüz algılanırsa üretim o aşamada reddedilir. Metni daha fazla düzeltmeden önce görseli düzenleyin, kırpın, çekimi genişletin ya da bir illüstrasyon kullanın.

Gerçek bir kişinin fotoğrafını yüklediğimde üretimim neden reddediliyor?

Bu bir prompt sorunu değil, platform düzeyinde kesin bir engeldir. Seedance 2.0 yüklenen görselleri, prompt işlenmeden önce tanınabilir gerçek yüzler için tarar. Ünlülerin, kamuya mal olmuş kişilerin veya tanınabilir bir benzerliğe sahip herhangi birinin fotoğrafları o aşamada reddedilir. Bunu aşmanın tek yolu illüstre ya da tanınamayan bir referansa geçmektir.

Kamera terminolojisi eklemek bir promptun işaretlenip işaretlenmemesinde gerçekten fark yaratır mı?

Evet. Prodüksiyon dili modele bunun bir film yaratma bağlamı olduğunu bildirir; bu da sade dille betimlemelere kıyasla daha geniş bir hoşgörüyle değerlendirilir. Çekim türleri, lens özellikleri ve ışık betimlemeleri eklemek, filtrenin tüm promptun niyetini nasıl yorumladığını değiştirir.

İlk ve son kare ile All-in-One Reference arasındaki fark nedir?

İlk ve son kare, tek görsel artı metin üretimleri içindir. All-in-One Reference ise birden fazla girdi türünü birleştirdiğiniz her durumda gereklidir: görseller, video klipler ve ses. Ayrıca @ etiketlemenin çalıştığı tek moddur.

Aynı yüklenmiş görseli birden fazla referans amacı için kullanabilir miyim?

Evet. Onu farklı rollerle birden çok kez etiketleyin. Örneğin: @Image 1 as the first frame, environment and lighting also based on @Image 1. Her rolün açıkça belirtilmesi gerekir.

İçinde olanı değiştirmeden bir video klibi nasıl uzatırım?

Onu yükleyin ve "Generate the content after @Video 1" yazın, ardından yeni segmenti betimleyin. Uzatma, bir klibe hangi şeyin götürdüğünü üretmek için geriye doğru da çalışır. Özgün görüntü yeniden üretilmez, dolayısıyla zaten sahip olduğunuz kısım olduğu gibi kalır. Bunun için "reference @Video 1" yazmayın: bu kelime modeli görevi bir referans görevi olarak ele almaya ve sizinkini sürdürmek yerine ona benzeyen bir video üretmeye iter.

Promptumu JSON olarak yapılandırmalı mıyım?

Buna gerek yok ve resmi bir desteği de yok. ByteDance'in belgelediği ideal, sade düzyazı bir hikâye panosudur: en başta bir görsel kayıt, ardından her biri bir kamera hareketi, bir eylem, bir konum ve sesini betimleyen Çekim 1, Çekim 2, Çekim 3. Yapı kesinlikle yardımcı olur; özellikle JSON söz dizimi olmaz. Ve yine de JSON'a başvuruyorsanız, her çekime bir duration alanı vermekten kaçının, çünkü çekimleri tam saniye sayılarına sabitlemek dengesizdir ve sonucu bozma eğilimindedir.

Hiç istemediğim halde altyazı ya da filigran çıkmasını nasıl engellerim?

Promptunuzu açık kısıt cümleleriyle kapatın: "Keep it subtitle-free. Avoid generating any text or subtitles." ve "Do not generate a logo or watermark." Bunlar olasılığı düşürür ama ortadan kaldırmaz. İki şey daha fazla yardımcı olur: yüklemeden önce referans varlıklarınızdaki gereksiz metni ayıklayın ve yapabildiğiniz yerde yatay üretin, çünkü başıboş altyazılar yatayda dikeye kıyasla belirgin biçimde daha seyrektir. Gerekiyorsa sonradan dikeye kırpın.

Aslında kaç referans dosyası yüklemeliyim?

İzin verilenden az. ByteDance toplamda 4 ila 5 varlık öneriyor: 1 ila 2 karakter görseli, 1 sahne görseli, 1 kamera hareketi videosu, 1 ses klibi. Bunun ötesinde model hangi özelliklerin öncelikli olduğunu ayırt etmekte zorlanır; stil çakışmaları, bulanık özne tanıması ve brifingten sapan çıktı alırsınız. İkincil stil referansları ve ruh hali tanımlayıcıları neredeyse her zaman yüklenen dosya olarak değil, promptta metin olarak daha iyi ele alınır. Bilmeniz gereken bir keskin sınır: referans olarak dörtten fazla kişi işin içine girdiğinde, kararlılık keskin biçimde düşer ve yanlış kişi sayısı veya çoğaltılmış karakterler görmeye başlarsınız.


Morphic'te üretmeye başlayın

Burada anlatılanları test etmenin en iyi yolu bir üretim açıp denemektir. Morphic'teki Seedance 2.0 size tam multimodal erişim verir: görsel, video, ses ve metin, hiçbir kurulum olmadan.