Google, Gemini 3.8 Live ve 3.5 Transcribe modellerini geliştiricilere açtı
Google, Gemini API ve Google AI Studio üzerinden Gemini 3.8 Live ile Gemini 3.8 Live Extended Thinking modellerini yayımladı; iki model de Live API üzerinden dakikada 0,005 dolar ses girişi ve 0,018 dolar ses çıkışı fiyatıyla sunuluyor. Şirket ayrıca geçen ay çıkardığı, 85+ dil destekli Gemini 3.5 Transcribe'ın özelliklerini ve ses ürün paketinin tamamını paylaştı.
Google, Gemini API ve Google AI Studio üzerinden geliştiricilere yönelik yeni ses modellerini yayımladı. Google DeepMind ürün yöneticisi Alisa Fortin ile Google DeepMind teknik ekip üyesi Thor Schaeff imzalı duyuruya göre yeni modeller Gemini 3.8 Live ve Gemini 3.8 Live Extended Thinking. Şirket bu yayımı, gerçek zamanlı ve ses öncelikli ürün deneyimleri kuran geliştiriciler için paketinin genişlemesi olarak tanımlıyor.
Gemini 3.8 Live ve 3.8 Live Extended Thinking, Live API üzerinden sunuluyor
Google'a göre Gemini 3.8 Live, yerel konuşmadan konuşmaya (speech-to-speech) modellerinde bir sıçrama niteliğinde: model diyaloğu sürdürürken görevleri de yerine getirebiliyor. Karmaşık istekler için geliştirilen Gemini 3.8 Live Extended Thinking daha derin akıl yürütme sunuyor ve Artificial Analysis'in Speech-to-Speech sıralamasında 1. sırada yer alıyor. Extended Thinking ayrıca yapılandırılabilir düşünme desteğiyle arka planda çok adımlı akıl yürütmeyi yürütürken ana konuşmada yanıt verebiliyor veya ilerlemeyi anlatabiliyor. İki model de Live API üzerinden erişilebilir durumda; fiyatlandırma ses girişi için dakikada 0,005 dolar, ses çıkışı için dakikada 0,018 dolar. Google, bu modellerin önceki live modellerine kıyasla bir sıçrama olduğunu ve kademeli (cascaded) mimarilere daha yalın bir alternatif oluşturduğunu belirtiyor.
Asenkron fonksiyon çağrısı, görsel bağlam ve 97+ dil desteği
Yeni modellerin öne çıkan yetenekleri arasında, arka planda API ve araç çağrılarını yürütürken kullanıcıya ses yanıtı akıtmaya devam eden asenkron fonksiyon çağrısı bulunuyor. Diyaloğu canlı görsel girdilere dayandıran görsel bağlam, onay kodları ve talep numaraları gibi alfanümerik verileri ayrıştıran hassasiyet, 97+ dil kapsamı ve aksan tutarlılığı ile gerçek zamanlı sesi yapılandırılmış verilerle birleştiren artımlı içerik güncellemeleri de listelenen yetenekler arasında. Google'ın verdiği bilgiye göre modellere Agora, Fishjam, LiveKit, LangChain, Pipecat, Vercel ve Vision Agents entegrasyon ortakları aracılığıyla da erişilebiliyor; bu ortaklar gerçek dünya kurulumları için medya akışı altyapısını üstleniyor.
Gemini 3.5 Transcribe: 85+ dilde ortalama %4,0 WER
Google, geçen ay yayımladığı Gemini 3.5 Transcribe'ın ayrıntılarını da paylaşıyor. Konuşmadan metne dönüştürmeye adanmış model 85+ dilde transkripsiyon sağlıyor ve ortalama Kelime Hata Oranı (WER) streaming'de %4,0, non-streaming'de %2,6 olarak ölçülmüş durumda. Modelin özellikleri arasında cümle içi ve cümleler arası dil geçişlerini elle yapılandırma gerektirmeden işleyen otomatik kod değiştirme, 1.000 terime kadar özel sözlük listesiyle alan terimlerine, nadir jargonlara, şirket adlarına ve özel adlara yönlendirme yapan sözlük eğilimi ile dolgu sözcüklerini temizleyip kendi kendini düzeltmeleri işleyen akıllı transkripsiyon modu yer alıyor. Google, modeli saniye altı altyazı, çağrı merkezi ajanları ve gerçek zamanlı ses analitiği gibi görevlerde dinleme motoru olarak konumlandırıyor. Model ayrıca Interactions API üzerinden 1 saate kadar ses dosyalarını yapılandırılmış zaman damgaları ve konuşmacı etiketleriyle metne çevirebiliyor.
Ses paketinin tamamı: Live Translate, Flash TTS ve Lyria 3.5
Google'ın Gemini API'de sunduğu ses paketi, transkripsiyon ve live modellerle sınırlı değil. Gemini 3.5 Live Translate 70'ten fazla dilde konuşmadan konuşmaya çeviri yapıyor. Gemini 3.1 Flash TTS yapılandırılabilir konuşma üretimi sunuyor ve şirket bu model için yeni güncellemelerin geleceğini belirtiyor. Lyria 3.5 ise prodüksiyon düzeyinde müzik üretimi sağlıyor. Geliştiriciler modelleri ai.studio/live adresinde deneyebiliyor, GitHub'dan örnek uygulamaları klonlayabiliyor veya ajanlarına live API becerisini ekleyebiliyor.