Diyarizasyon Nedir? Yapay Zekâ Transkripte Konuşmacı Etiketlerini Nasıl Ekler?

2026-07-09
KKevin Wong

Diyarizasyon (konuşmacı ayrıştırma), bir ses kaydında "kim ne zaman konuştu" sorusunu yanıtlayan süreçtir. Bir röportajı veya toplantıyı transkribe ettiğinizde, akan metni konuşma sıralarına bölüp her birini etiketleyen katman diyarizasyondur — Konuşmacı 1, Konuşmacı 2, Konuşmacı 3 — böylece transkript, ayrışmamış tek bir kelime yığını yerine bir sohbet gibi okunur. Ham bir dikteyi, bir tartışmanın kullanılabilir bir kaydına dönüştüren şey budur.

Bu açıklayıcı yazı, ayrıştırmanın gerçekte ne olduğunu, yapay zekânın etiketleri arka planda nasıl atadığını, röportajlar, toplantılar ve araştırma için neden önemli olduğunu ve o etiketleri daha doğru kılan pratik adımları ele alıyor. Aşağıdaki her teknik iddia, mevcut bir transkripsiyon hizmetinin dokümantasyon sayfasına dayanıyor; böylece kaynağı kendiniz de kontrol edebilirsiniz.

Diyarizasyon nedir — yapay zekâ transkripte konuşmacı etiketlerini nasıl ekler


Diyarizasyon (konuşmacı ayrıştırma) nedir?

Diyarizasyon, bir ses akışını konuşmacı kimliğine göre bölme görevidir. Transkripsiyon motorunun, kişilerin kim olduğunu isimleriyle bilmesine gerek yoktur — yalnızca kaç farklı sesin mevcut olduğunu ve hangi konuşma kesitlerinin her birine ait olduğunu çözer. Google'ın Cloud Speech-to-Text hizmeti çıktıyı açıkça şöyle tarif eder: "Transkripsiyon sonucu her kelimeyi, ayrı ayrı konuşmacılara atanmış bir numarayla etiketler. Aynı konuşmacının söylediği kelimeler aynı numarayı taşır." (Google Cloud Speech-to-Text dokümantasyonu)

Birbirine karıştırıldığı için ayırmaya değer birkaç terim var:

  • Transkripsiyon konuşmayı kelimelere dönüştürür.
  • Ayrıştırma o kelimeleri konuşmacıya göre gruplar ve anonim etiketler atar (Konuşmacı 1, Konuşmacı 2…).
  • Konuşmacı tanıma (veya konuşmacı kimliklendirme) bir adım öteye gider ve bir sese bilinen bir kimlik bağlar — bu genellikle önceden bir ses örneği veya referans klip gerektirir ve çoğu transkripsiyon iş akışı bunu atlar.

Yani "transkriptteki konuşmacı etiketleri" ayrıştırmadır, kimliklendirme değil. Etiketler, kimin kim olduğunu öğrendiğinizde kendiniz yeniden adlandırdığınız yer tutuculardır.

Bu, kanal ayrımından da farklıdır. Eğer her kişi kendi ses kanalında kaydedildiyse — her konuğun ayrı bir mikrofona sahip olduğu bir podcast ya da temsilcinin bir kanalda, müşterinin başka bir kanalda olduğu bir çağrı merkezi kaydı gibi — ayrıştırmaya hiç ihtiyacınız yoktur. AWS buna kanal kimliklendirme der ve onu konuşmacı bölütlemeden ayrı bir yaklaşım olarak ele alır. (AWS Transcribe dokümantasyonu) Ayrıştırma ise daha zor ve daha yaygın olan durumdur: tek bir karışık kanalda birden fazla kişi.


Yapay zekâ konuşmacı etiketlerini nasıl atar?

Ayrıştırma, kelimeleri yazan modelle aynı model değildir. Transkripsiyonun yanında bir katman olarak çalışır ve üst düzeyde dört şey yapar:

  1. Ses aktivitesi algılama (VAD) — konuşma içeren kesitleri bulur, sessizliği ve gürültüyü atar.
  2. Bölütleme — konuşmayı kısa, türdeş parçalara ayırır; ses özelliklerinin değiştiği noktalardan (olası bir konuşmacı değişimi) keser.
  3. Gömme (embedding) — her kesiti, gerçekte söylenen kelimelerden bağımsız olarak perde, tını ve diğer akustik özellikleri yakalayan sayısal bir ses parmak izine dönüştürür.
  4. Kümeleme — benzer parmak izlerine sahip kesitleri bir araya gruplar. Her küme bir konuşmacı etiketi olur.

Etiketler daha sonra transkripte geri iliştirilir. Örneğin AWS Transcribe, en fazla 30 benzersiz konuşmacıyı ayırt edebilir ve her birini spk_0 ile spk_9 gibi bir değerle etiketler; her ifadenin başlangıç ve bitiş zamanını içeren ayrı bir speaker_labels bölümü döndürür. (AWS Transcribe dokümantasyonu) Google'ın çıktısı kelime düzeyinde aynı şekilde çalışır; her kelimeye bir speakerLabel numarası iliştirir ve bir sonucun "Cloud Speech-to-Text'in ses örneğinde benzersiz olarak tanımlayabildiği kadar çok konuşmacıya kadar numara içerebileceğini" belirtir. (Google Cloud dokümantasyonu)

Önemli bir incelik: ayrıştırma, konuşma modelleri arasında evrensel değildir. OpenAI'nin dokümantasyonu, temel transkripsiyon modellerinin konuşmacı etiketlemeyi doğrudan desteklemediğini ve ayrıştırmanın "konuşmacı farkındalıklı transkriptler üreten" özel, ayrıştırma yetenekli bir model tarafından yapıldığını belirtir. (OpenAI Speech-to-Text rehberi) Başka bir deyişle, en iyi kelimeleri yazan motor, en iyi konuşmacı sınırlarını çizen motor değildir — ki bu da, birden çok modeli kıyaslayıp aralarında yönlendirme yapan bir transkripsiyon ürününün burada neden avantajlı olduğunu açıklar. Subanana'nın yapay zekâ transkripsiyon aracının ardındaki yaklaşım tam da budur: sistem konuşma modellerini sürekli kıyaslar ve tek bir sağlayıcıya kilitlenmek yerine kaynak dile ve göreve göre en iyi performansı göstereni seçer.


Konuşmacı etiketleri neden önemli?

Ayrıştırma olmadan, çok kişili bir kayıt, bir soruyu yanıtından ayıramayacağınız tek bir metin bloğuna dönüşür. Etiketler, transkripti gezilebilir ve alıntılanabilir kılan şeydir. Bunun belirleyici olduğu dört ortam:

  • Röportajlar ve gazetecilik. Asıl mesele atıftır. Bir cümleyi tam olarak kaynağın mı söylediğini yoksa muhabirin mi sorduğunu bilmeniz gerekir; ayrıca bir alıntıyı yayımlamadan önce sese karşı doğrulayabilmek için zaman damgalı olmasına ihtiyaç duyarsınız.
  • Toplantılar ve tutanaklar. "Kim neyi taahhüt etti" yalnızca eylem maddeleri bir kişiye bağlandığında işe yarar. Ayrıştırılmış bir transkript, bir toplantıyı konuşmacıya göre taramanıza ve her katılımcının kararlarını ve takip işlerini çekmenize olanak tanır.
  • Niteliksel araştırma ve kullanıcı deneyimi çalışmaları. Odak gruplarını veya kullanıcı görüşmelerini kodlayan araştırmacılar yanıtları katılımcı bazında analiz eder. Konuşma sıraları analizin birimidir — onlar olmadan moderatörün çerçevelemesini katılımcının tepkisinden ayıramazsınız.
  • Hukuki, tıbbi ve uyum kayıtları. Bir doktor-hasta görüşmesi ya da bir ifade tutanağı, ancak her beyan doğru biçimde atfedildiğinde bir kayıt olarak işe yarar.

Bunların her birinde, ayrıştırma kalitesi sonradan ne kadar manuel temizlik yapacağınızı belirler. İyi etiketler saatler kazandırır; kötü etiketler ise yanlış atfedilmiş konuşma sıralarını düzeltmek için sesi yeniden dinlemek anlamına gelir. Bu nedenle ayrıştırma, Subanana'nın transkript modunun çekirdek bir parçasıdır; bu mod, konuşmacı kimliklendirmesi, otomatik dolgu sözcüğü temizliği ve kaynak metin için otomatik noktalama ve paragraflama içeren temiz, okunabilir bir transkript üretir.


Ayrıştırma doğruluğunu ne etkiler?

Ayrıştırma transkripsiyondan daha zordur ve belirli koşullar altında bozulur. En büyük etkenler:

EtkenKonuşmacı etiketlerine etkisiNeye yardımcı olur
Üst üste binen konuşmaİnsanların birbirinin sözünü kesmesi ses parmak izlerini bulanıklaştırırSırayla konuşmayı teşvik edin; çakışmalarda bir miktar manuel düzeltme bekleyin
Ses kalitesiArka plan gürültüsü ve düşük bit hızı akustik özellikleri bulandırırMikrofona yakın kaydedin; ortam gürültüsünü azaltın
Benzer seslerPerdesi ve tınısı birbirine yakın iki konuşmacı tek bir etikette birleştirilebilirKonuşmacı başına daha fazla ses, modelin onları ayırmasına yardımcı olur
Çok kısa konuşma sıralarıTek kelimelik araya girmeler modele parmak izi çıkaracak çok az şey bırakırKaçınılmaz; düzenleyicide temizleyin
Bilinmeyen konuşmacı sayısıModelin kaç küme oluşturacağını tahmin etmesi gerekirBiliyorsanız konuşmacı sayısını ona söyleyin

O son nokta, en yüksek getirili tek ipucudur. Çoğu motor bir konuşmacı sayısı ipucunu kabul eder ve bir tane vermek, kümeleme adımını kısıtlayarak ne fazla ne de az bölmesini sağlar. Google'ın Speech-to-Text hizmeti, "min_speaker_count ve max_speaker_count değerlerini beklediğiniz konuşmacı sayısına göre ayarlamanızı" ister; AWS ise bir iş başlatırken bir MaxSpeakerLabels değeri geçmenize izin verir. (Google Cloud dokümantasyonu · AWS Transcribe dokümantasyonu)


Subanana'da doğru konuşmacı etiketlerini nasıl elde edersiniz?

Subanana'nın transkript modu ayrıştırmayı otomatik olarak çalıştırır ve en çok önem taşıyan girdiler üzerinde size denetim verir. İş akışı:

Adımİşlem
1. YüklemeSes veya video dosyanızı ekleyin ya da yerel bir indirme olmadan içe aktarmak için herkese açık bir YouTube, Instagram veya Facebook bağlantısı yapıştırın
2. Kaynak dili ayarlamaSistemin o dil için en iyi kıyaslanmış modele yönlendirebilmesi adına kayıtta konuşulan dili seçin
3. Konuşmacı sayısını ayarlamaOtomatik tespiti seçin ya da zaten biliyorsanız konuşmacı sayısını elle girin — elle verilen ipucu genellikle daha temiz bir ayrım üretir
4. Transkribe etmeSubanana birden çok kalite katmanı çalıştırır — dil başına en iyi kıyaslanmış model, otomatik model değişimiyle halüsinasyon tespiti ve düzenleyicide CPS işaretleme
5. Yeniden adlandırma ve düzenlemeDüzenleyicide "Konuşmacı 1 / Konuşmacı 2"yi gerçek isimlerle değiştirin, yanlış atfedilmiş konuşma sıralarını düzeltin ve otomatik noktalama ile paragraflamayı uygulayın
6. Dışa aktarmaTXT, DOCX, XLSX, SRT, VTT veya Markdown olarak indirin

Çalışırken bilmeye değer birkaç şey:

  • Transkript hakkında doğrudan düzenleyicide sorular sorabilirsiniz — örneğin "Konuşmacı 2'nin önerdiklerini özetle" — toplantınıza dayandırılmış yerleşik yapay zekâ sohbetini kullanarak.
  • Yapay zekâ destekli düzeltme geçişi, olası yanlış duyulmuş kelimeleri ve benzer sesli hatalı sözcükleri onayınıza sunmak üzere işaretler; böylece incelediğiniz metin önceden temizlenmiş olur.

Toplantılarınız Google Meet veya Microsoft Teams üzerinde gerçekleşiyorsa, takvim tetiklemeli toplantı botu çağrı bittikten sonra onları kaydedip transkribe edebilir, ardından kayıt üzerinde aynı ayrıştırma ve özet hattını çalıştırabilir.

Ayrıştırma, yalnızca yanlış gittiğinde fark ettiğiniz özelliklerden biridir. Pratik reçete basittir: motora verebileceğiniz en temiz sesi verin, kaç konuşmacı bekleyeceğini söyleyin ve tek bir sağlayıcıya kilitli olan değil, diliniz için en güçlü modele yönlendiren bir araç kullanın. Kendi ses kaydınızdaki konuşmacı etiketlerini görmek için ücretsiz transkribe etmeye başlayabilir ya da fiyatlandırma sayfasında planları karşılaştırabilirsiniz.


Sık sorulan sorular

Konuşmacı ayrıştırma, konuşmacı tanımayla aynı şey mi? Hayır. Ayrıştırma sesleri ayırır ve anonim etiketler atar (Konuşmacı 1, Konuşmacı 2). Tanıma bir sese bilinen bir ad bağlar ve genellikle bir referans örnek gerektirir. Çoğu transkripsiyon iş akışı ayrıştırmayı kullanır ve etiketleri elle yeniden adlandırmanıza izin verir.

Kişi başına ayrı bir mikrofona ihtiyacım var mı? Hayır — ayrıştırma, yaygın durum olan tek bir karışık kanalda çalışır. Eğer kişi başına bir kanalınız varsa (ayrı kanallar), bu, AWS'nin dokümantasyonunda belirttiği gibi farklı ve daha basit bir yaklaşım olan kanal ayrımıdır. (AWS Transcribe dokümantasyonu)

Transkript neden iki kişiyi tek bir konuşmacıda birleştirdi? Genellikle sesleri akustik olarak benzer olduğu için, ses gürültülü olduğu için ya da motora kaç konuşmacı bekleyeceği söylenmediği için. Bir konuşmacı sayısı vermek ve daha temiz ses kullanmak en etkili iki çözümdür.

Tüm konuşmadan metne modelleri konuşmacı etiketlemeyi destekler mi? Hayır. Bazı temel transkripsiyon modelleri doğrudan ayrıştırma yapmaz ve OpenAI'nin dokümantasyonunun gösterdiği gibi ayrı, ayrıştırma yetenekli bir modele ihtiyaç duyar. (OpenAI Speech-to-Text rehberi) Modeller arasında kıyaslama yapıp yönlendiren bir araç, bu tek model sınırlamasından kaçınır.

Subanana ile Verimliliğinizi Artırın

Ödeme yöntemi gerekmez
Ücretsiz Deneme
İstediğiniz Zaman İptal Edin