Gemini videoyu baştan sona izlemiyor artık, işine yarayan yeri arıyor
Google, Gemini’ye ajan tabanlı video anlama ekledi. Model videoyu sabit kareyle tarayacağına, gereken sahneyi kendi buluyor. Maliyet düşüyor, uzun kayıtlar daha işe yarar hale geliyor.- Yayınlanma: 16:02 - 2 Eylül 20262 Eylül 2026 - 16:02
- Güncelleme: 16:02 - 2 Eylül 2026
- 18 kez okundu

Eski yöntem basitti. Video neredeyse her zaman aynı tempoda işlenirdi. Varsayılan hız saniyede bir kareydi. Geliştirici isterse API’den kare hızını yükseltebilirdi ama mantık değişmezdi. Kayıt baştan sona, eşit aralıklarla okunurdu. Kısa bir reklamda bu yeterliydi. Ama 90 dakikalık derste yetmez. Saatlerce güvenlik kaydında hiç yetmez. Ya her kareye para ödersin ya da arada kalan anı kaçırırsın. Google tam bu sıkışmayı kırmak istiyor.
Yeni yöntem videoyu tek parça yemek zorunda değil. Gemini görüntü karesine, sese ve transkripte birlikte bakıyor. Sonra üç soruyu kendisi soruyor. Nereye bakayım? Ne hızda bakayım? Bu iş için kare mi, ses mi, yazı mı daha işe yarar? Cevabı bulunca yalnızca o parçayı içeri alıyor. Geliştiriciler benzer bir işi daha önce elde, kendi kodlarıyla kurabiliyordu. Şimdi aynı döngüyü model kendi içinde çeviriyor. İlgili dilimi yüklemek için dahili bir araç kullanıyor. Elle örülen iş akışı da böylece azalıyor.
Google’ın kıyaslama rakamları ise şöyle. Analiz maliyeti yüzde 66’ya kadar düşüyor. Token tüketimi yüzde 88’e kadar azalıyor. Doğruluk yüzde 7’ye kadar artıyor. Üç sayı birden gelince insan şüphelenir. Yine de yön net: aynı işe daha az malzeme yakılıyor, sonuç bozulmuyor, biraz da toparlanıyor. Kazanç üç modelde de anlatılıyor. Gemini 3.7 Flash, 3.6 Flash ve 3.5 Flash-Lite. Google, kalite ile maliyetin en iyi dengesini 3.7 Flash’ta görüyor. Video işinde “hem ucuz hem doğru” çizgisinin ucunda durduğunu söylüyor.
Bu yaklaşım, daha önce görüntü tarafında denenen ajan tabanlı bakışa benziyor. Orada da model körü körüne bütün kareyi yutmuyordu. Kod çalıştırma ile yereldeki görüntü anlama birleşiyordu. Video sürümünde araç seti değişiyor. Sistem, analiz için Gemini’nin kendi video araçlarını kullanıyor. Dışarıdan ağır bir düzenleme programı kurmana gerek kalmıyor.
Ne işe yarar, o daha önemli. Birincisi saniyenin altındaki anlar. Saniyede bir kareyle bakan sistem, bir kesme sınırını veya bir durum değişimini atlayabiliyor. Yeni yöntem o aralığı sıkıştırıp tekrar bakabiliyor. Otomatik kurgu buna dayandırılıyor. İkincisi uzun kayıtta samanlıkta iğne aramak gibi. Saatlik videoda “şu cümle nerede geçti, şu nesne ne zaman göründü” diye sormak eskiden token’ı eritirdi. Şimdi soru, ilgili dakikaya inebiliyor. Üçüncüsü anormallik. Hızlı hareket, ince kusur, kayan bir kare. Model şüpheli aralığı daha yüksek kare hızıyla yeniden örnekliyor. Dördüncüsü sayma. Tekrarlayan hareket, geçen nesne, sahneye giren çıkan şey. Bunlar reklamdan çok fabrika, spor ve eğitim kaydının işi.
Özellik şimdi Google AI Studio ve Gemini API üzerinden duruyor. Hem yüklenen dosya hem YouTube videosu kabul ediliyor. Fiyat ayrı bir kalem değil. Standart token tarifesi işliyor. Açmak için API ayarında işlemeyi agent diye işaretlemek yetiyor. Google bir geliştirici kılavuzu da yayımladı. Kısa süre içinde aynı yetenek Flash ve Flash-Lite üzerinden Gemini uygulamasındaki kullanıcılara inecek. Sonraki durak YouTube. “Videoya Sor” kısmının, yalnızca altyazıya değil görüntüye de bakarak cevap vermesi planlanıyor.
E tabi bir sınır da var. Model hâlâ görevin tarifine bağlı. Kötü soru, yanlış yere bakmayı da beraberinde getirir. Çok uzun ve dağınık kayıtlarda ilk tarama yine zaman alır. “Yüzde 88 token azaldı” cümlesi her projede aynı çıkmayabilir. Yine de işin mekanizması artık değişti. Video artık tek tip kare yığını değil, aranacak bir yer. Gemini’nin yeni işi bütün filmi ezberlemek değil, lazım olan dakikayı bulmak.






