Google Gemini 3.5 Transcribe kullanıma sunuldu: 85’ten fazla dil ve gerçek zamanlı transkripsiyon

Google, canlı konuşmaları ve kayıtlı sesleri metne dönüştürmek için geliştirdiği Gemini 3.5 Transcribe modelini duyurdu. 85’ten fazla dili destekleyen sistem; saniyenin altında gecikme, konuşmacı ayrımı, özel sözlük ve kelime düzeyinde zaman damgaları gibi özellikler sunuyor.
Google Gemini 3.5 Transcribe kullanıma sunuldu: 85’ten fazla dil ve gerçek zamanlı transkripsiyon

Google, konuşmaları yazıya dönüştürmeye odaklanan yeni Gemini 3.5 Transcribe modelini kullanıma sundu. Canlı görüşmelerden önceden kaydedilmiş toplantılara kadar farklı ses kaynaklarıyla çalışabilen model, geliştiriciler ve kurumsal müşteriler için genel önizlemeye açıldı.

Yeni sistem yalnızca duyduğu kelimeleri metne çevirmekle yetinmiyor. Konuşmanın bağlamını anlamaya, aksanları ve özel terimleri doğru yorumlamaya, hatta kişinin konuşurken yaptığı düzeltmeleri yakalamaya çalışıyor. Arka plan gürültüsü bulunan ortamlarda da kullanılabilen model; canlı altyazı, sesli asistan, toplantı kaydı ve çağrı analizi gibi pek çok senaryoyu hedefliyor.

Canlı ve kayıtlı sesler için iki ayrı model

Gemini 3.5 Transcribe, kullanım şekline göre iki farklı çalışma seçeneği sunuyor. Gemini 3.5 Transcribe Live, gerçek zamanlı konuşmalar için geliştirilirken standart Gemini 3.5 Transcribe daha önce kaydedilmiş ses dosyalarına odaklanıyor.

Canlı model, Gemini Live API üzerinden sürekli ve çift yönlü ses akışıyla çalışabiliyor. Google, gecikmenin bir saniyenin altında olduğunu belirtiyor. Bu sayede konuşmanın neredeyse eş zamanlı olarak altyazıya çevrildiği uygulamalar veya telefon görüşmelerinde çalışan sesli asistanlar geliştirilebiliyor.

Kayıtlı seslere yönelik model ise toplantı, röportaj ve çağrı kayıtlarını işleyebiliyor. Kelime düzeyinde zaman damgaları oluşturması, uzun bir kayıtta belirli bir kelimenin veya konuşmanın geçtiği noktaya ulaşmayı kolaylaştırıyor.

Özellik

Gerçek zamanlı mod

Kayıtlı ses modu

Model

Gemini 3.5 Transcribe Live

Gemini 3.5 Transcribe

API

Gemini Live API

Etkileşimler API’si

Kullanım alanı

Canlı altyazı, sesli asistan, görüşmeler

Toplantı, çağrı kaydı, röportaj

Gecikme

Bir saniyenin altında

Dosyanın işlenmesine bağlı

Zaman damgası

Canlı akışa uygun

Kelime düzeyinde

Konuşmacı ayrımı

Uygulamaya göre değişiyor

Üç konuşmacıya kadar destek

85’ten fazla dili otomatik tanıyabiliyor

Gemini 3.5 Transcribe, 85’ten fazla dilin yanı sıra farklı bölgesel aksanları ve lehçeleri destekliyor. Üstelik kullanıcının konuşmaya başlamadan önce dili manuel olarak seçmesi gerekmiyor.

Doğal konuşmanın beraberinde getirdiği küçük sorunlar da hesaba katılmış. Örneğin kişi cümlesini yarıda kesip kendisini düzelttiğinde model, mümkün olduğunca ifadenin son hâlini metne aktarıyor. “Iıı” veya “eee” gibi dolgu sesleri de isteğe bağlı olarak temizlenebiliyor.

Ortaya çıkan metin noktalama işaretleri ve paragraflarla otomatik olarak düzenlenebiliyor. Böylece ham bir konuşma dökümü yerine okumaya daha hazır bir sonuç elde etmek mümkün oluyor.

Özel sözlük sayesinde teknik terimler öğretilebiliyor

Standart konuşma tanıma sistemlerinin zorlandığı alanlardan biri, alışılmadık isimler ve sektöre özgü terimler. Google bunun için Gemini 3.5 Transcribe’a özel sözlük desteği ekliyor.

Geliştiriciler modele marka isimleri, ürün kodları, teknik ifadeler veya sektörel jargon tanımlayabiliyor. Bu özellik özellikle sağlık, hukuk, mühendislik, teknik destek ve müşteri hizmetleri gibi kendine özgü terminolojisi bulunan alanlarda işe yarayabilir.

Modelin posta kodu ve sipariş numarası gibi harflerle rakamların birlikte kullanıldığı ifadeleri de gürültülü ortamlarda algılayabildiği belirtiliyor.

Konuşmacıları birbirinden ayırabiliyor

Kayıtlı seslerin işlenmesinde dikkat çeken bir diğer özellik, konuşmacı ayrımı. Gemini 3.5 Transcribe, bir kayıttaki üç kişiye kadar konuşmacıyı ayrı ayrı etiketleyebiliyor.

Örneğin üç kişinin katıldığı bir toplantı kaydı işlendiğinde, kimin hangi cümleyi söylediği zaman damgalarıyla birlikte gösterilebiliyor. Bu da toplantı notlarını sonradan incelemeyi veya belirli bir kişinin açıklamalarını bulmayı kolaylaştırıyor.

Üçten fazla kişinin bulunduğu kayıtlar için de destek mevcut. Ancak Google, bu özelliğin şimdilik deneysel aşamada olduğunu belirtiyor.

Kelime hata oranı yüzde 2,6’ya kadar düşüyor

Google’ın açıkladığı test sonuçları, yeni modelin doğruluk tarafında da ilerleme kaydettiğini gösteriyor. Gerçek zamanlı akış senaryolarında ortalama kelime hata oranı yüzde 4,0 olarak ölçülüyor.

Önceden kaydedilmiş seslerde ise bu değer yüzde 2,6’ya kadar düşebiliyor. Daha düşük kelime hata oranı, konuşmadaki sözcüklerin daha yüksek doğrulukla metne aktarıldığı anlamına geliyor.

Çok dilli konuşma tanımayı değerlendiren FLEURS testinde model, akışlı kullanımda yüzde 5,50, akışsız kullanımda ise yüzde 5,04 kelime hata oranı elde etmiş durumda. Elbette gerçek sonuçlar mikrofon kalitesi, dil, aksan, konuşma hızı ve ortam gürültüsüne göre değişebiliyor.

Google ayrıca önceki Chirp 3 transkripsiyon modeliyle karşılaştırıldığında nihai metnin oluşturulma süresinde yüzde 70 iyileşme sağlandığını belirtiyor. Bu fark, özellikle canlı görüşmenin ardından düzenlenmiş metnin hızlı şekilde gösterilmesi gereken uygulamalarda önem kazanıyor.

Gboard’daki Rambler özelliğinin arkasında da bu model var

Gemini 3.5 Transcribe yalnızca geliştiricilere yönelik bağımsız bir model olarak kalmayacak. Google, teknolojiyi kendi uygulamalarına da entegre ediyor.

Android için Gboard’da bulunan Rambler özelliği bunlardan biri. Rambler, kullanıcının konuşmasını olduğu gibi yazmak yerine dağınık düşünceleri daha düzenli bir metne çevirebiliyor. Gereksiz kelimeleri ayıklayabiliyor ve sesli komutlarla mevcut metinde değişiklik yapılmasına izin veriyor.

Bu yaklaşım, klasik sesli yazmadan biraz farklı. Amaç yalnızca “söyleneni yazmak” değil, konuşarak kullanılabilecek daha kapsamlı bir metin düzenleme deneyimi oluşturmak.

Gemini ve Antigravity bağlamdan yararlanabiliyor

Google Antigravity içerisinde Gemini 3.5 Transcribe, kullanıcı izin verdiğinde ekrandaki bilgilerden ve sohbet geçmişinden yararlanabiliyor. Açık belgeler, dosya adları ve mevcut çalışma bağlamı, özel ifadelerin daha doğru anlaşılmasına yardımcı olabiliyor.

Örneğin telaffuzu aynı ancak yazımı farklı iki kelime arasında seçim yapılması gerektiğinde, ekrandaki içerik modele doğru seçeneği belirlemesi için ek bağlam sağlayabiliyor. Google, ekran içeriği ve sohbet geçmişinin kullanıcı tarafından verilen izinler doğrultusunda işlendiğini belirtiyor.

macOS için Gemini uygulaması da Gemini 3.5 Transcribe’dan yararlanıyor. Kullanıcılar doğal konuşmalarını biçimlendirilmiş metne dönüştürebiliyor ve ekran bağlamından yararlanan sesli komutlar verebiliyor.

Transkripsiyon modelinin doğrudan yapamadığı görevlerde ise diğer Gemini modelleri devreye girebiliyor. Örneğin dosya analizi veya görsel oluşturma gibi işlemler, fonksiyon çağırma yoluyla uygun modele aktarılabiliyor.

Chrome’a konuşarak metin girme özelliği geliyor

Google’ın sıradaki hedeflerinden biri de Chrome. Şirket, Gemini 3.5 Transcribe teknolojisini tarayıcıya entegre etmeye hazırlanıyor.

Planlanan özellikle kullanıcılar web sitelerindeki form, yanıt ve gönderi alanlarına konuşarak yazı girebilecek. Sistem gerektiğinde konuşmayı doğrudan aktarmak yerine daha okunabilir bir metne dönüştürebilecek.

Chrome entegrasyonunun ne zaman genel kullanıma açılacağı ise henüz açıklanmış değil.

Gemini 3.5 Transcribe genel önizlemede

Gemini 3.5 Transcribe şu anda geliştiriciler ve kurumsal müşteriler için genel önizleme aşamasında. Geliştiriciler modele Google AI Studio ve Google Antigravity üzerinden Gemini API aracılığıyla erişebiliyor.

Kurumsal tarafta erişim Gemini Enterprise Agent Platformu üzerinden sağlanıyor. Müşteri deneyimine yönelik Gemini Enterprise entegrasyonunun ise daha sonra kullanıma sunulması planlanıyor.

Tüketici tarafındaki erişim henüz ülkeye, dile ve kullanılan ürüne bağlı. Model macOS Gemini uygulamasında İngilizce desteğiyle kullanılabilirken Android tarafında desteklenen bölgelerde Gboard Rambler üzerinden sunuluyor. Chrome entegrasyonunun da ilerleyen dönemde bu kullanım alanlarını daha da genişletmesi bekleniyor.

Yorum Yaz
Yorum yapabilmek için giriş yap veya üye ol.
Yorumlar