antalia-1 / README.tr.md
cloud0day3's picture
Upload README.tr.md with huggingface_hub
eaec2aa verified
|
Raw History Blame Contribute Delete
18.9 kB
metadata
language:
  - tr
license: openrail
license_name: antalia-openrail-m
license_link: LICENSE.md
library_name: antalia
pipeline_tag: text-to-speech
tags:
  - text-to-speech
  - turkish
  - flow-matching
  - rectified-flow
  - single-speaker
  - safetensors
datasets:
  - google/fleurs
  - cloud0day3/antalia-voice-corpus
base_model: cloud0day3/antalia-1-foundation

Antalia 1

Tek izinli sesle, eksiksiz yayımlanmış açık bir Türkçe metinden konuşma modeli.

Dinle Kod Makale Temel Külliyat Lisans

English model card: README.md

Bu modelin geliştirilmesi durduruldu. Bu, memnun kaldığımız son kontrol noktasıdır; temel modelle, kodla, 5 saatlik ses külliyatıyla, değerlendirme setiyle, teknik raporla ve modelin neyi yapıp neyi yapamadığının dürüst bir dökümüyle birlikte yayımlanmıştır. Burada hiçbir şey ürün olarak sunulmuyor ya da bakımı yapılmıyor. İletişim: sezgin@patientdesk.ai veya GitHub issues.

Bir bakışta

Görev Tek sabit sesle Türkçe metinden konuşma. Sıfır atışlı klonlama yok.
Mimari Karakter koşullu düzeltilmiş akış (rectified flow, "CrossFlow" uygulamamız): 4 bloklu ConvNeXt metin kodlayıcı, 768 boyutlu 16 Transformer akış bloğu, tek skaler süre başlığı.
Boyut 304,6 milyon parametre, fp32 safetensors, 1,22 GB.
Çıkış 24 kHz mono. Model 100 bantlı log-mel kareleri üretir; NVIDIA BigVGAN v2 (donmuş, ayrıca indirilir) bunları sese çevirir.
Girdi Sayıları, tarihleri, para birimlerini ve kısaltmaları açık yazan belirlenimci bir normalleştiriciden geçmiş Türkçe harfler.
Anlaşılırlık Tek tohumda CER 0,053; 8'den en iyisi seçimiyle 0,030 (Whisper-large-v3, 120 istemlik turkish-v2 seti).
Ses kimliği Otomatik benzerlik 0,93–0,94 okur, ancak ana dili Türkçe bir dinleyici 12 sentez–gerçek çiftinin 0'ını aynı kişi olarak değerlendirdi. Bkz. aşağıdaki "İyi yapamadığı şeyler" bölümü.
Reçete inference-recipe.json içinde kayıtlı v2: metin rehberliği 4,0; yeniden ölçekleme 0,5; gürültü zarfı sabitleme; sway −0,8; 32 Euler adımı; ≤120 karakterde cümle parçalama.
Lisans Ağırlıklar: Antalia OpenRAIL-M (LICENSE.md); modeli kullanan veya yeniden dağıtan her şeyde yazarlara atıf zorunludur. Kod: Apache-2.0.
Eğitim verisi Common Voice 26.0 Türkçe (CC0), FLEURS Türkçe (CC-BY-4.0) ve izin veren tek bir seslendirme sanatçısının antalia-voice-corpus olarak yayımlanan 5,008 saatlik kaydı (CC-BY-4.0).

Dinleyin

Aşağıdaki her kayıt yapay zekâ ile üretilmiştir. Hiçbiri gerçek bir kişinin kaydı değildir. CER, istem metnine göre Whisper-large-v3 karakter hata oranı; Benz., seslendirme sanatçısının kayıtlarına WavLM x-vektör kosinüs benzerliğidir. Bunlar yayın reçetesiyle üretilmiş 8'den en iyisi kayıtlarıdır. Örnek sitesinde altmıştan fazla kayıt, her biri ham tek tohumlu hâliyle eşlenmiş olarak ve setteki en kötü dokuz hata ile birlikte yer alır.

Sesİstem
Sabah güneşi sessiz sokağın taşlarına yavaşça vuruyordu.
Genel · CER 0,00 · Benz. 0,972
Maalesef başvurunuz bu aşamada onaylanmadı, fakat yeniden değerlendirme isteyebilirsiniz.
Duygusal ton · CER 0,00 · Benz. 0,966
İşlemi şimdi tamamlamamı ister misiniz, yoksa daha sonra mı arayalım?
Sorular ve onaylar · CER 0,00 · Benz. 0,967
Kimlik doğrulaması için doğum tarihinizin yalnızca gün ve ay bilgisini söyler misiniz?
Sesli asistan · CER 0,00 · Benz. 0,971
Yiğit Efe'nin dosyası Ankara'nın Çankaya ilçesindeki Mithatpaşa Caddesi'ne gönderildi.
İsimler ve yerler · CER 0,00 · Benz. 0,962
Doktorunuz tahlil sonuçlarını inceledikten sonra tedavi planını güncelleyecek, yeni reçeteniz eczane sistemine aktarılacak, kontrol randevunuz oluşturulacak ve bütün ayrıntılar size güvenli mesaj yoluyla bildirilecektir.
Uzun metin, 18,7 s, cümle sınırlarından parçalanmış · CER 0,00 · Benz. 0,971

Nerede zorlanıyor

Aynı dürüstlük hatalar için de geçerli. İlk satır setteki en kötü tek tohumlu sonuçtur ve 8'den en iyisi seçiminin ne kazandırdığını gösterir; ikincisi hiçbir tohumun düzeltmediği bir durum; üçüncüsü parçalama reçetesinin var olma sebebi olan uzun girdi hatasıdır.

İstemKayıtlar
Prof. Dr. Öz'ün 21.09.2026 tarihli e-reçete no.'su 004781'dir.
Normalleştirme. Whisper ham kaydı "Prof. Dr. 21 Eylül 2026 tarihli erihli e-reçete no. suf 47-8-1'dir." olarak duydu. Sekiz tohumda CER 0,13–0,38 aralığındaydı.
Tek tohum, CER 0,32

8'den en iyisi, CER 0,13
Toplam tutar ₺1.275,50 ve indirim oranı %18 olarak görünüyor.
Sayılar. Whisper "Toplam tutar 1275 lira 50 kuruş ve indirim oranı %18 olarak görünüyor." duydu. CER normalleştirilmemiş isteme göre hesaplandığından doğru okunan bir tutar bile burada hata sayılır; hiçbir tohum 0,13'ün altına inmedi.
Tek tohum, CER 0,13

8'den en iyisi, CER 0,13
Başvurunuzu tamamladıktan sonra belgeleriniz güvenli biçimde incelenecek … (370 karakter)
Uzun girdi. Süre başlığı tüm pasaj için tek bir uzunluk bütçeler. Parçalanmadan 9,1 saniyelik aceleci bir konuşma; ≤120 karakterde parçalanınca 34,8 saniye.
Parçalanmamış, 9,1 s

Parçalanmış, 34,8 s

Hızlı başlangıç

git clone https://github.com/0daycloud/antalia
cd antalia
uv sync            # veya: pip install -e .

# Vokoder: BigVGAN yeniden dağıtılmaz. Sabitlenmiş commit + tek satırlık hub yaması.
git clone https://github.com/NVIDIA/BigVGAN /opt/bigvgan
git -C /opt/bigvgan checkout 7d2b454564a6c7d014227f635b7423881f14bdac
patch -d /opt/bigvgan -p4 < scripts/patches/bigvgan-huggingface-hub-1.patch
export PYTHONPATH=/opt/bigvgan

python scripts/synthesize-crossflow.py \
  --checkpoint cloud0day3/antalia-1 \
  --vocoder nvidia/bigvgan_v2_24khz_100band_256x \
  --speaker voicedata-candidate-b \
  --prosody -1.2398956 1.1943912 -2.1267404 -0.9549347 0.9637866 0.5145879 \
  --text-guidance 4.0 --sway -0.8 --steps 32 --mel-clamp 5.0 \
  --min-seconds-per-char 0.085 --chunk-chars 120 \
  --text "Merhaba, randevunuzu yarın saat on dört otuz için yeniden planladım." \
  --output merhaba.wav

--checkpoint bir Hub depo kimliği, yerel bir yayın dizini veya bir eğitim .pt dosyası kabul eder. Yükleyici nvidia/bigvgan_v2_24khz_100band_256x (MIT) deposunu Hub'dan indirir. Python 3.12; CUDA GPU önerilir, CPU yavaş çalışır.

8'den en iyisi seçimi için --evaluation-suite ... --seed-candidates 8 ile adaylar üretin ve bu depodaki timbre-profile.json ile envelope-stats.json dosyalarını kullanarak scripts/select-best-of-n.py çalıştırın. Konuşma stili ön ayarları prosody-presets.json içinde, reçetenin tamamı inference-recipe.json içindedir.

Sonuçlar

120 istemlik Türkçe değerlendirme setimizde ölçüldü (10 kategori × 12 istem; Whisper-large-v3 ile CER/WER, sesin ayrılmış gerçek kayıtlarına karşı WavLM-base-plus-sv x-vector benzerliği).

Yapılandırma CER ort. CER p90 WER ort. Konuşmacı benz. ort. Konuşmacı benz. p10
Tek tohum, 32 Euler adımı 0,0528 0,1348 0,1297 0,9331 0,9054
8 tohumdan en iyisi, tını süzgeçli seçim 0,0298 0,1007 0,0934 0,9445 0,9170

Onaylar, sorular ve teyitler, sesli asistan cümleleri, duygusal stil ve genel cümleler genellikle tek tohumda temiz çıkar. 16 Euler adımı, aynı ortalama benzerlikle üretim süresini %45 kısaltır; p10 benzerliği biraz düşer.

Reçete v2, bu kontrol noktasında 40 istem × 8 tohum üzerinde v1'e karşı ölçüldü: tohumlar arası tını kayması 2,088 → 1,520 (gerçek ses referansı 1,414), tek tohumlu CER 0,0717 → 0,0615.

İyi yapamadığı şeyler

  1. Ses benzerliği en büyük eksik. Otomatik benzerlik 0,93–0,94 okur; ancak kör bir yerli dinleme oturumunda (27 deneme, 3/3 kontrol denemesi temiz) dinleyici, sentez ile gerçek kayıt çiftlerinin 12'sinden 0'ını aynı kişi olarak değerlendirdi; gerçek sese karşı çapalı karşılaştırmalarda CMOS −1,83 ± 0,76 çıktı. Dinleyici farkı tınıya bağladı; bant analizi 4,7–6,8 kHz aralığında +4,0 dB fazlalık (z = +3,5) ve formant bölgesinde bir eğim gösterdi; kaynak akustik model, vokoder değil. Yayımlanan adaptör aşaması ve seçimdeki tını cezası ölçülen cezayı düşürdü (2,585 → 1,997) ancak gerçek ses aralığının (0,47–0,98) dışında kaldı. Bu tek ve çalışmayı bilen bir dinleyiciydi; çok dinleyicili MOS tasarlandı ama hiç yapılmadı.
  2. Uzun girdiler. Model her girdi için tek bir toplam süre tahmin eder ve uzun metni eksik bütçeler: parçalanmamış 370 karakterlik bir girdi 9,1 saniyelik aceleci konuşma verir; parçalanmışı 34,8 saniyedir. Reçete bu yüzden cümleyi ≤120 karakterlik parçalara böler, 160 ms duraklar ekler ve boşluk dışı karakter başına 0,085 s taban uygular. Parçalama uzun biçim WER'ini ölçümlerimizde %36,6'dan %10,7'ye düşürdü.
  3. Sayılar, normalizasyon ağırlıklı metin, yabancı adlar ve kısaltmalar en yüksek hata oranlarına sahiptir. 8'den en iyisi seçimi kısmen kurtarır (bir istemde CER 0,32 → 0,13); bazı istemler sekiz tohumun hepsinde başarısız olur.
  4. Tohum değişkenliği büyüktür. Sıradan istemlerde istem başına CER tohumlar arasında 0,00–0,17 aralığına yayılır. Başlıktaki 8'den en iyisi sayıları sekiz üretim ile Whisper ve WavLM puanlaması gerektirir.
  5. Yalnızca Türkçe, belirlenimci bir normalleştiriciden sonra harf girdisi, 24 kHz mono, tek ses.
  6. Ezberleme denetimi yapılmadı; ses filigranı yok.

Dosyalar

Dosya Amaç
model.safetensors EMA ağırlıkları, fp32, 304.552.293 parametre. SHA-256 853a117ef95fa44efff785a6b674f380878da57879cb879d6d099d1e1444266e
config.json antalia-crossflow-release-v1 yayın biçimi: mimari, mel istatistikleri, sözlük, konuşmacı sözlüğü, vokoder işaretçisi, köken bilgisi
inference-recipe.json Örnekleme reçetesi v2: rehberlik 4,0; yeniden ölçekleme 0,5; gürültü zarfı sabitleme; sway −0,8; 32 adım; parçalama; kare tabanı; 8'den en iyisi puanlaması
prosody-presets.json Konuşma stili başına altı boyutlu prozodi hedefleri (sıcak, soru, empati, açıklama, sayılar, fonetik)
timbre-profile.json, envelope-stats.json Seçicinin kullandığı, gerçek sese ait toplu istatistikler
LICENSE.md Antalia OpenRAIL-M

Mimari

  • Metin: belirlenimci Türkçe normalleştirici → karakterler → gömme + sinüzoidal konumlar → 4 ConvNeXt tarzı derinlemesine evrişim bloğu (çekirdek 7, boyut 768).
  • Süre: tek bir skaler başlık log toplam kare sayısını tahmin eder. Hizalayıcı yok, belirteç başına süre yok.
  • Akustik model: 16 Transformer bloğu (boyut 768, 12 baş, SwiGLU FFN 3072); mel kareleri üzerinde öz dikkat, karakterler üzerinde çapraz dikkat, akış zaman adımından sıfır başlatılmış adaLN modülasyonu ve her blokta sıfır başlatılmış konuşmacı/stil darboğaz adaptörü (boyut 128).
  • Koşullama: 256 boyutlu konuşmacı gömmesi ve 6 boyutlu prozodi vektörü (log saniye/karakter, log enerji ort./std, log F0 ort./std, sesli oran) sıfır başlatılmış projeksiyonlarla; metin ve konuşmacı üzerinde sınıflandırıcısız rehberlik.
  • Vokoder: BigVGAN v2 24 kHz 100 bant 256x, donmuş.

Sıfır atışlı ses kopyalama yoktur: konuşmacı tablosunda yalnızca bu ses (voicedata-candidate-b) ve eğitimde kullanılan anonim Common Voice konuşmacı kimlikleri bulunur. Konuşmacı kimliği 0, koşulsuz temel yoldur.

Eğitim verisi ve soy zinciri

Tüm aşamalarda yalnızca şunlar kullanıldı: Common Voice 26.0 Türkçe (CC0; 59.593 süzülmüş klip), FLEURS Türkçe (CC-BY-4.0; 1.876 klip) ve yayımlanan sesin izinli kayıtları (621 metin hizalı parça / 2,965 saat, sonra 1.073 düzeltilmiş parça / 5,008 saat). Kazınmış ses, başka kişilerin özel kayıtları veya üçüncü taraf TTS ağırlıkları kullanılmadı. Süzgeç manifestleri ve kalite raporları kod deposundadır.

Aşama Başlangıç Güncelleme Eğitilen Veri
Temel v3 sıfırdan 100.000 tümü CV + FLEURS, 67,55 saat
Konuşmacı koşullama temel 3.000 konuşmacı gömmeleri/projeksiyonları CV konuşmacı kimlikleri
Ses gömmesi önceki 100 tek konuşmacı gömmesi 621 ses parçası
CFG ince ayarı önceki 8.000 akustik bloklar 41.277 CV + 621 ses
Tutarlılık ince ayarı önceki 6.000 akustik bloklar 41.277 CV + ses ×10
Tını adaptörü (yayımlanan) önceki 1.400 3,16 milyon adaptör parametresi 1.073 ses parçası

Ses külliyatı da yayımlandı

Bu modelin ince ayarında kullanılan 1.073 parça / 5,008 saat, antalia-voice-corpus adıyla CC-BY-4.0 altında yayımlandı: ses, birebir metinler ve kayıt başına sinyal ile hizalama ölçümleri. Seslendirme sanatçısı, yalnızca bu ağırlıkların değil, kayıtların kendisinin de kamuya dağıtılmasına izin veren bir ek sözleşme imzaladı.

Stüdyo kalitesinde, izinli, tek konuşmacılı Türkçe konuşma verisi nadirdir ve bazı kullanımlar için külliyat bu kontrol noktasından daha yararlıdır: aynı ses üzerinde farklı bir mimariyi ince ayarlamak, okuma konuşması üzerinde Türkçe ASR, prozodi ve normalleştirme araştırması (11 kategoride sayılar, geri okuma, yabancı terimler ve kademeli ifade bilinçli olarak kapsanır) veya hakları izlenebilir temiz bir Türkçe referans seti. 24 kHz mono, ortanca SNR 34,9 dB, her kayıt kalite geçidinin tamamından geçmiş.

Yalnızca eğitim bölümü yayımlanmıştır. Ana kayıt bakımından ayrık sınama bölümü yayımlanmadığından, yukarıdaki konuşmacı benzerliği değerleri bu külliyattan bağımsız olarak yeniden üretilemez.

Kullanım amacı ve kısıtlar

Türkçe konuşma sentezi araştırması, yapay zekâ olduğu açıkça belirtilen tek sesli asistan ve prototipler ve yukarıda belgelenen hata biçimlerinin incelenmesi. Open RAIL-M lisansı gerçek kişileri taklit etmeyi, aldatıcı veya dolandırıcı kullanımı, siyasi otomatik aramaları ve sesin sentetik olduğunu açıklamadan kullanmayı yasaklar. Ayrıca atıf gerektirir: modelin veya türevlerinin her dağıtımı ile bunları kullanan her ürün, hizmet veya yayın, bu depoya ya da kod deposuna bağlantıyla birlikte Sezgin Saygili, Emre Kaplaner, Oncel Ozgul ve Fikri San Koktas (Patientdesk.ai) tarafından geliştirilen "Antalia 1"e atıfta bulunmalıdır. Seslendirme sanatçısı bu ağırlıkların ve kayıtlarının dağıtımına izin verdi; sesinin gerçek bir kişinin kaydı gibi sunulan türev veri kümelerine değil.

Atıf

@misc{antalia1_2026,
  title  = {Antalia 1: An Open Turkish Text-to-Speech Model from a Rights-Clean Pipeline},
  author = {Saygili, Sezgin and Kaplaner, Emre and Ozgul, Oncel and Koktas, Fikri San},
  year   = {2026},
  note   = {Technical report},
  url    = {https://huggingface.co/cloud0day3/antalia-1}
}

Teşekkür

Sesi bu olan isimsiz seslendirme sanatçısına; Common Voice katkıcılarına; BigVGAN için NVIDIA'ya. "Antalia" adı yazarların tescilli markası değildir.