Açık yayın

Antalia 1 — açık bir Türkçe metinden konuşma modeli.

Geliştirme durduruldu; eksiksiz yayımlandı. Tek bir profesyonel ses, yaklaşık 300 milyon parametre, 24 kHz’de rectified-flow akustik model. Bu sayfada modelin neyi iyi yaptığını ve nerede yetersiz kaldığını, her örneğin arkasındaki sayılarla birlikte dinleyebilirsiniz.

Dinleyin

Her kategoriden iki örnek, ham ve seçilmiş

120 istemli turkish-v2 değerlendirme setinden, kategori başına iki tane olmak üzere yirmi istem. Her kart aynı cümleyi iki kez çalar: ilk rastgele tohumla üretilen hâli ve otomatik bir puanla (WavLM konuşmacı benzerliği eksi Whisper karakter hata oranı, eksi küçük F0 zarfı ve tını cezaları) sekiz tohum arasından seçilen en iyisi. CER, istem metnine göre Whisper-large-v3 karakter hata oranıdır; Benzerlik, seslendirme sanatçısının kayıtlarına WavLM x-vektör kosinüs benzerliğidir. Seçim 8 kat hesaplama maliyeti getirir.

Nerede başarısız oluyor

Sayılar, normalleştirme ve yabancı terimler

Bunlar sette en yüksek hata oranına sahip istemler: altısı tek tohumda en kötü sonuçlar, üçü seçimden sonra en kötü sonuçlar. Bazıları tek tohumda başarısız olup 8’de en iyi seçimiyle düzeliyor; bazılarını seçim puanı içindeki hiçbir tohum düzeltemiyor. Her cümlenin altındaki not, sekiz adayın tümündeki CER aralığını gösterir.

Uzun girdiler

Tüm girdi için tek bir süre

Model, her girdi için havuzlanmış metin kodlamasından tek bir toplam çerçeve sayısı tahmin eder; belirteç başına süre ve hizalayıcı yoktur. Uzun metinlerde bu tahmin yetersiz kalır: aynı 370 karakterlik pasaj tek geçişte verildiğinde 9,1 saniyelik aceleci ve geveleyen bir konuşma, çıkarım katmanı onu cümle sınırlarından böldüğünde (≤120 karakter, 160 ms duraklama, boşluk dışı karakter başına 0,085 s taban) 34,8 saniye üretir. Parçalama, tek tohumda uzun metin WER’ini %36,6’dan %10,7’ye düşürdü.

Temel model, koşulsuz

Antalia 1 Foundation, konuşmacıdan bağımsız temeldir (299,6M parametre; 67,55 saat Common Voice 26 ve FLEURS Türkçe verisi üzerinde 100.000 güncelleme). Konuşmacı kimliği 0 ile kimseye ait olmayan ortalama bir ses üretir. Setteki tek tohum CER’i 0,18’dir; bu iki örnek, ince ayar aşamalarının başladığı noktadır.

32 yerine 16 adım

Euler adımlarını yarıya indirmek üretim süresini %45,1 azalttı. Ortalama konuşmacı benzerliği 32 adımlı tarifin 0,0006 içinde kaldı; 10. yüzdelik benzerlik daha düşüktü. Yayın tarifi 32 adım kullanır.

Değerlendirme

Neler çalışıyor, neler çalışmıyor

Neler çalışıyor

  • Kısa, günlük Türkçe anlaşılır. Set genelinde tek tohum CER 0,053 (p90 0,135); 8’de en iyi CER 0,030 (p90 0,101).
  • Deterministik normalleştiriciyle harf tabanlı girdi. Sayılar, tarihler, para birimleri ve kısaltmalar sentezden önce kodla açık yazılır; fonem sözlüğü gerekmez.
  • Cümle parçalama uzun girdileri kullanılabilir kılar. ≤120 karakterlik parçalarla uzun metin WER’i %36,6 → %10,7.
  • Donmuş, şeffaf bir vocoder. BigVGAN v2 24 kHz, gerçek mel yeniden kurmada ±0,4 dB içinde ölçülür; dolayısıyla duyduğunuz hatalar akustik modelden gelir.
  • Yayın eksiksizdir. Her iki kontrol noktası, eğitim, seçim ve değerlendirme kodu, 120 istemlik set, dinleme protokolü ve ham sonuçları herkese açık. Seslendirme sanatçısının kayıtları değil.

Neler çalışmıyor

  • Ses benzerliği. Otomatik benzerlik 0,93–0,94 okuyor, ama sesi tanıyan ana dili Türkçe bir dinleyici 12 sentez–gerçek çiftinin 0’ını aynı kişi olarak değerlendirdi. Fark, presence bandındaki bir tını sapmasıdır (4,7–6,8 kHz’de +4,0 dB). En büyük kısıt budur.
  • Uzun girdiler. Toplam süre başlığı yetersiz bütçeler; cümle parçalama (≤120 karakter) ve karakter başına çerçeve tabanı olmadan uzun cümleler acele eder ve geveler.
  • Sayılar, normalleştirme ağırlıklı metin, yabancı isimler ve kısaltmalar en yüksek CER’e sahiptir. 8’de en iyi kısmen düzeltir; bazı istemler sekiz tohumun tümünde başarısız olur.
  • Tek tohum varyansı büyüktür. İstem başına CER tohumlar arasında 0,00–0,17’ye kadar açılır. Başlık sayıları, Whisper ve WavLM puanlayıcılarıyla 8’de en iyi seçimine bağlıdır; bu da 8 kat hesaplama maliyeti demektir.
  • Tek sabit ses. Sıfır atışlı klonlama yok, yalnızca Türkçe, 24 kHz, harf tabanlı girdi.
  • Çok dinleyicili MOS yok, ezberleme denetimi yok, filigran yok.
  • Gecikme. A100 üzerinde 32 adım ve bellekte hazır modelle 5 saniyelik bir cümle ısınmadan sonra yaklaşık 2,1–2,3 s sürer; ilk istek yaklaşık 6 s. İptal edilen Cloud Run L4 ön üretim ortamında ilk sese kadar geçen süre düşük yükte p50 5,0 s / p95 9,2 s idi.

İnsan dinleme değerlendirmesi

Bir dinleyici, yirmi yedi deneme, tek bir karar

9 Ağustos 2026’da, seslendirme sanatçısının sesini tanıyan tek bir ana dili Türkçe dinleyiciyle (proje sahibi) karşılaştırmalı bir MOS oturumu yapıldı. 27 gerçek deneme; 3 kontrol denemesi doğru değerlendirildi. Havuzlanmış CMOS adaya doğru −0,667 ± 0,653 idi. Kapılı sunum tarifi, düz tarife karşı +0,267 ± 0,728 aldı (n = 15). Gerçek kayıtlara karşı sentezlenen konuşma −1,833 ± 0,757 aldı (n = 12) ve dinleyici 12 çiftin 0’ını aynı kişi olarak değerlendirdi.

Kategori bazında: duygu +2,0, genel +2,0, sorular +0,2, onaylama 0,0, uzun −0,5, isimler ve yerler −1,0, sesli asistan −1,0, yabancı −1,14, sayısal −2,0, normalleştirme −2,5.

Oturum, v5 öncül kontrol noktasını değerlendirdi. Seçimdeki tını cezası ve Antalia 1’e dönüşen adaptör aşaması buna yanıt olarak geldi; ölçülen cezayı 2,585’ten 1,997’ye düşürdüler, ancak bu değer gerçek ses aralığının (0,47–0,98) hâlâ dışındadır. ≥3 dinleyicili bir protokol tasarlandı ve hiç uygulanmadı. Bu model için çok dinleyicili MOS yoktur; otomatik konuşmacı benzerliği kimlik kanıtı olarak okunmamalıdır.

Aynı kişi
0 / 12sabitlenmiş sentez–gerçek
Gerçeğe karşı CMOS
−1,83± 0,76, n = 12
Havuzlanmış CMOS
−0,67± 0,65, n = 27
Dinleyici
1ana dili Türkçe, bilgili

Mimari

Harfler girer, mel çerçeveleri çıkar

CrossFlow tarzı bir rectified-flow modelinin bağımsız uygulaması. Harfler bir kez kodlanır; akustik kod çözücü, çapraz dikkat yoluyla onlara koşullanmış 100 bantlı log-mel çerçevelerinin gürültüsünü giderir. F5-TTS veya FreyaTTS ağırlıklarını, kodunu, sesini ya da verisini kullanmaz ve bunlara bağlı değildir.

Antalia 1 sinyal akışı Metin, Türkçe normalleştiriciden geçip dört ConvNeXt bloklu karakter kodlayıcıya girer. Kodlayıcı, toplam çerçeve sayısını tahmin eden süre başlığını besler ve 16 akış bloğuna çapraz dikkat anahtarları sağlar. Gürültü çerçeveleri ile metin koşullaması, her biri öz dikkat, çapraz dikkat, SwiGLU ileri besleme, zaman adımı ve konuşmacı bağlamından adaLN modülasyonu ve artık adaptör içeren akış bloklarından geçer. Çıktı, BigVGAN v2 tarafından 24 kHz dalga biçimine dönüştürülen 100 bantlı bir mel spektrogramdır. Metin Türkçe, her hâlde Normalleştirici sayı, tarih, kısaltma Karakter kodlayıcı gömme + sinüzoidal konum 4 ConvNeXt bloğu · boyut 768 Süre başlığı havuz → log toplam çerçeve çerçeve sayısı çapraz dikkat anahtarları Gürültü T × 100 mel çerçevesi 16 akış bloğu · boyut 768 · 12 kafa öz dikkat → çapraz dikkat → SwiGLU (3072) zaman adımı bağlamından 9 yollu adaLN modülasyonu sıfır başlatılmış darboğaz adaptörü (128) + stil vektörü Mel 100 bant · hop 256 BigVGAN v2 donmuş, MIT Ses 24 kHz zaman adımı t · konuşmacı gömmesi (256) · 6 boyutlu prozodi · CFG metin 4,0 / konuşmacı 1,0 Euler, 32 adım sway −0,8 · mel kırpma 5,0
Çıkarımda sinyal akışı. Konuşmacı ve prozodi koşullaması yalnızca ince ayarlı kontrol noktasında vardır; temel kontrol noktasında yalnızca konuşmacı kimliği 0 bulunur. 8’de en iyi seçimi tüm yolu sarar ve isteğe bağlıdır.
turkish-v2 üzerinde otomatik ölçümler (120 istem, Whisper-large-v3 CER/WER, WavLM x-vektör benzerliği)
Sistem CER ort. CER p90 WER ort. Benzerlik ort. Benzerlik p10
Temel v3 @100k, koşulsuz, tek tohum 0,18350,40490,39520,8162*0,625*
v5 tutarlılık @6000, tek tohum 0,08400,23250,18700,93150,8913
v5 8’de en iyi (tını kapılı, w = 0,05) 0,03750,11270,10590,94230,9113
Antalia 1 (adaptör v2 @1400), tek tohum 0,05280,13480,12970,93310,9054
Antalia 1 8’de en iyi (tını kapılı) 0,02980,10070,09340,94450,9170

* Temel modelin benzerliği, hiç görmediği yayımlanan sese karşı ölçülmüştür; yalnızca doğrulayıcının tabanı olarak verilmiştir. 0,93’ün üzerindeki benzerlik değerleri insan kimlik yargılarıyla örtüşmedi (bkz. İnsan dinleme değerlendirmesi).

Yerelde çalıştırın

Bir cümle sentezleyin

Hiçbir şey barındırılmıyor. Yükleyici, kontrol noktasını Hugging Face’ten, vocoder’ı nvidia/bigvgan_v2_24khz_100band_256x deposundan çeker. GPU önerilir; bu sayfadaki sayılar A100 üzerinde ölçüldü.

  1. Depoyu klonlayın ve paketi kurun.

    git clone https://github.com/0daycloud/antalia
    cd antalia
    uv sync            # veya: pip install -e .
  2. BigVGAN kaynak ağacını kurun. Vocoder yeniden dağıtılmaz: depo 7d2b4545 commit’ini sabitler ve tek satırlık bir huggingface_hub uyumluluk yaması içerir. README’deki “Vocoder” bölümünü izleyin.

    # BigVGAN source tree (pinned commit + one-line hub patch), see README "Vocoder"
  3. Sentezleyin.

    python scripts/synthesize-crossflow.py \
      --checkpoint cloud0day3/antalia-1 \
      --vocoder nvidia/bigvgan_v2_24khz_100band_256x \
      --speaker voicedata-candidate-b \
      --text "Merhaba" \
      --output merhaba.wav

--checkpoint bir Hub depo kimliği, yerel bir yayın dizini veya bir eğitim .pt dosyası kabul eder. 8’de en iyi seçimi için --seed-candidates 8 ile tohum adayları üretin ve ağırlık deposundaki timbre-profile.json ile envelope-stats.json dosyalarını kullanarak scripts/select-best-of-n.py çalıştırın.