OĞUZ EROL // ads & ai
WhatsApp

Telefonda Ses Kaydını Yapay Zekâya Okutma

5 dk okuma12 Ağustos 2026

Sorunun kısa cevabı şu: tek bir uygulama aramayın, işi ikiye bölün. Kaydı telefonun kendi ses kaydedicisiyle alın, çözümlemeyi bilgisayarda yerel bir Whisper kurulumuyla yapın. Böylece hem en iyi doğruluğu alırsınız hem de kaydınız hiçbir sunucuya gitmez.

Çoğu insan “en iyi ses kaydı uygulaması hangisi” diye arıyor ama asıl fark uygulamada değil, kaydın sonra nereye gittiğinde. Telefonda kaydetmek zaten çözülmüş bir problem; iş, o kaydı yazıya çevirirken başlıyor.

Kayıt tarafı: telefonunuzdaki uygulama zaten yeterli

Samsung’un Ses Kaydedici’si ve iPhone’un Sesli Notlar’ı bu iş için fazlasıyla yeterli. İkisi de m4a formatında kaydeder ve m4a, aşağıda anlatacağım araçların doğrudan okuyabildiği bir format — dönüştürmeye gerek yok.

Üçüncü parti bir kayıt uygulaması indirmenin pratik bir faydası yok, aksine riski var: ücretsiz kayıt uygulamalarının bir kısmı kaydı kendi bulutuna yüklüyor ve bunu kullanım şartlarının içine gömüyor. Cihazın kendi uygulaması bu açıdan en temiz seçenek.

Kayıt kalitesi için üç pratik şey:

  • Telefonu ağzınıza yakın tutun. Whisper gürültüyle iyi başa çıkıyor ama uzaktan alınmış, yankılı bir kayıtta hata oranı belirgin biçimde artıyor.
  • Araba içi kayıtlarda camı kapatın. Yol gürültüsü, transkripti en çok bozan şeylerden biri.
  • Uzun kaydı bölmeyin. Yarım saatlik bir kaydı parçalamaya gerek yok; Whisper tek seferde çözer, sadece işlem süresi uzar.

Asıl karar: sesi kim çözecek?

Kayıt bittikten sonra iki yol var ve aralarındaki fark teknik değil, mahremiyet.

Bulut yolu. Telefonun kendi transkripsiyon özelliği, ChatGPT’ye ses yükleme, çeşitli “toplantı notu” uygulamaları. Kolay ve hızlı. Ama sesiniz bir sunucuya gidiyor ve orada ne kadar kaldığını, ne için kullanıldığını sözleşme metninden okumanız gerekiyor.

Yerel yol. Ses dosyası bilgisayarınızdan hiç çıkmıyor. Kurulumu bir kereliğine biraz uğraştırıyor, sonrası tek komut.

Şunu net söyleyeyim: her kayıt için yerel çözüm şart değil. Kendinize aldığınız alışveriş notunu buluta göndermenin bir sakıncası yok. Ama şu üç durumda yerel kalmak gerçekten önemli:

  1. Müşteri görüşmesi kaydı — karşı tarafın verisi söz konusu, KVKK kapsamına giriyor.
  2. Henüz açıklanmamış bir iş fikri veya strateji — kendi ticari sırrınız.
  3. Sağlık, hukuk, finans içeren konuşmalar — özel nitelikli veri sayılabilir.

Yerel Whisper: hangi araç, hangi model

Whisper, OpenAI’ın açık kaynaklı konuşma tanıma modeli. “Açık kaynak” burada önemli: modeli indirip kendi bilgisayarınızda çalıştırıyorsunuz, OpenAI’a bağlanmıyorsunuz.

Araç olarak faster-whisper. Orijinal Whisper ile aynı doğruluğu veriyor ama yaklaşık dört kat hızlı çalışıyor ve daha az bellek kullanıyor. Ayrıca torch kurulumu gerektirmiyor, bu da kurulumu belirgin biçimde sadeleştiriyor.

Model olarak large-v3. Burada en sık yapılan hatayı özellikle vurgulamak istiyorum: turbo modelini Türkçe için kullanmayın. Dört kat hızlı olduğu doğru, ama İngilizce dışındaki dillerde doğruluk kaybı yaşıyor. Türkçe kayıtlarda large-v3 doğru tercih.

Kod yazmak istemiyorsanız arayüzlü seçenekler de var: Windows’ta Subtitle Edit içinde Whisper entegre geliyor, Buzz ve Vibe çoklu platform çalışıyor, Mac’te MacWhisper oldukça olgun. Hepsi aynı modeli kullanıyor; fark sadece arayüz.

Kurarken karşınıza çıkacak üç şey

İlk çalıştırmada model iniyor. large-v3 yaklaşık 3 GB. Bir kereliğine iniyor, sonraki çalıştırmalarda anında başlıyor.

Ekran kartı varsa çok hızlanır, yoksa yine çalışır. GPU’da float16 ile çalıştığında yarım saatlik bir kayıt birkaç dakikada çözülüyor. Ekran kartı yoksa araçlar otomatik olarak işlemciye düşüyor — sonuç aynı, süre uzuyor.

Dili elle belirtin. Otomatik dil algılama, kaydın ilk saniyeleri sessiz ya da gürültülüyse bazen yanlış dil seçiyor ve tüm transkripti bozuyor. Dili “Türkçe” olarak sabitlemek bu riski tamamen kaldırıyor.

Transkripti yapay zekâya verirken

Whisper size ham metin veriyor: noktalama var ama paragraf yok, konuşmacı ayrımı yok, “şey”, “yani” gibi dolgu sözcükleri duruyor. Bu metni doğrudan bir yapay zekâya verip “özetle” demek çalışır ama sonuç ortalama olur.

Daha iyi sonuç için transkripti verirken ne istediğinizi söyleyin: “Bu benim sesli notum, içinden yapılacaklar listesi çıkar” ya da “Bu bir müşteri görüşmesi, itirazları ve verdiğim sözleri ayır” gibi. Bağlamı verdiğinizde çıktı belirgin biçimde iyileşiyor.

Konuşmacı ayrımı (kim ne dedi) ayrı bir iş — Whisper tek başına bunu yapmıyor. Gerekiyorsa WhisperX gibi araçlarla ekleniyor ve doğruluğu ortam kalitesine çok bağlı.

Kendi kurulumum

Ben sesli notlarımı telefonla alıyorum, bilgisayarda faster-whisper + large-v3 ile GPU üzerinde çözüyorum. Kayıtlar bilgisayarımdan hiç çıkmıyor. Yarım saatlik bir notu tek komutla metne çeviriyorum, sonra o metni yapay zekâ asistanıma verip içinden karar ve yapılacak maddelerini çıkartıyorum.

Bu kurulumu bilinçli olarak seçtim: notlarımda müşteri adı, fiyat konuşması ve henüz yayınlamadığım iş fikirleri geçiyor. Bunları üçüncü taraf bir servise göndermeyi doğru bulmuyorum — kendi verimde uygulamadığım bir standardı müşterime de öneremem.

Yedek olarak whisper.cpp de kurulu duruyor; ekran kartıyla ilgili bir sorun çıkarsa doğruluk biraz düşse de iş görüyor.

Bu işi benden isteyebilirsiniz

Kurulumu kendiniz yapmak istemiyorsanız ya da bunu bir ekip için kurmak gerekiyorsa yardımcı olabilirim: yerel transkripsiyon kurulumu, kayıttan otomatik özet ve aksiyon çıkaran bir akış, ya da bunun şirket içi bir araca dönüştürülmesi. Uzaktan, saatlik ücretle çalışıyorum. İletişim sayfasından yazabilirsiniz.

İlgili yazılar: toplantı kaydından otomatik rapor ve aksiyon ve yapay zekâ veri güvenliği.

Sıkça Sorulan Sorular

Telefonumun kendi transkripsiyon özelliği yeterli değil mi?

Kısa notlar için çoğu zaman yeterli. İki sınırı var: uzun kayıtlarda doğruluk düşebiliyor ve işlemin cihazda mı yoksa sunucuda mı yapıldığı her zaman net olmuyor. Hassas bir içerik yoksa kullanın; müşteri görüşmesi ya da ticari bilgi içeren bir kayıtsa yerel çözüm daha güvenli.

Yerel Whisper için güçlü bir bilgisayar şart mı?

Şart değil, ama ekran kartı olması işi hızlandırıyor. Ekran kartı olan bir makinede yarım saatlik kayıt birkaç dakikada çözülüyor; sadece işlemciyle çalışan bir dizüstünde aynı kayıt yarım saati bulabiliyor. Sonuç aynı, tek fark bekleme süresi. Küçük modellerle hızlanabilirsiniz ama Türkçede doğruluk gözle görülür şekilde düşüyor.

Türkçede doğruluk gerçekten iyi mi?

large-v3 ile net kayıtlarda oldukça iyi sonuç veriyor; kelime hata oranı tipik olarak %10-20 aralığında kalıyor ve bu, notu okuyup anlamanız için fazlasıyla yeterli. Özel isimler, marka adları ve teknik terimlerde hata yapabiliyor — bunları transkripti kullanmadan önce hızlıca göz gezdirip düzeltmek gerekiyor.

Bir görüşmeyi kaydetmeden önce izin almalı mıyım?

Kendi sesli notunuz için sorun yok. Ama karşı tarafla yapılan bir görüşmeyi kaydediyorsanız izin alın ve bunu kayda da söyleyin. Kişisel veri niteliğindeki bir konuşmayı izinsiz kaydetmek hukuki risk taşıyor; ayrıca kaydı sakladığınız yer ve süre de KVKK kapsamına giriyor.