Gazetecinin yapay zekâ destekli dijital ikiziyle konuşulabiliyor
SanalData’yı Google’da tercih edilen kaynak olarak ekleyinSynthesia, bir gazetecinin sesini ve görüntüsünü kullanarak yalnızca belirli bir yazı hakkında yanıt verebilen etkileşimli bir dijital avatar oluşturdu.
Yapay zekâ destekli avatarlar, yalnızca önceden hazırlanmış metinleri okuyan sanal sunucular olmaktan çıkıp kullanıcılarla konuşabilen sistemlere dönüşüyor. Video üretim girişimi Synthesia, bu teknolojiyi bir gazetecinin dijital ikizini oluşturmak için kullandı. Ortaya çıkan avatar, kendisine yöneltilen soruları dinliyor ve yalnızca eğitildiği yazının içeriği hakkında yanıt veriyor.
Avatarın hazırlanması için gazeteciden çok sayıda fotoğraf alındı ve yaklaşık iki dakikalık bir ses kaydı yapıldı. Çalışma sonunda, farklı görünümlere sahip kişisel avatarlar ile etkileşimli avatarlar üretildi. Etkileşimli sürümler, karşısındaki kişinin konuşmasını algılayıp buna göre yanıt verebiliyor. Gözlüklü ve gözlüksüz seçeneklerin hazırlanması da çalışmanın bir parçası oldu.
Avatar yalnızca belirli bir yazı hakkında konuşuyor
Synthesia’nın oluşturduğu dijital ikiz, genel amaçlı bir sohbet botu olarak tasarlanmadı. Sistem, gazetecinin girişim destekli girişimlerde neden daha fazla dolandırıcılık görüldüğünü ele alan yazısı üzerinden eğitildi. Bu nedenle avatar; yazının neden hazırlandığı, araştırma makalesinin ne anlattığı ve araştırmacıların hangi sonuçlara ulaştığı gibi sorulara yanıt verebiliyor.
Bu sınırlı kapsam, dijital avatarların nasıl kullanılabileceğine dair önemli bir ayrıntı sunuyor. Avatarın belirli bir konuya odaklanması, kullanıcıların yanıtları hangi bilgi tabanına dayanarak aldığını daha anlaşılır hâle getiriyor. Aynı zamanda sistemin, kendisine öğretilmeyen alanlarda konuşmasının önüne geçilmesini amaçlıyor.
Avatarla konuşmak isteyen kullanıcıların etkileşimli pencereyi yeni bir sekmede başlatması gerekiyor. Kullanıcı, gazetecinin yazısıyla ilgili sorusunu sesli veya etkileşimli arayüz üzerinden yöneltiyor; sistem ise bu soruyu işleyerek avatarın yanıt vermesini sağlıyor.
Sistemin arkasında birden fazla yapay zekâ modeli var
İnteraktif avatar tek bir modelden oluşmuyor. Kullanıcının söylediklerini metne dönüştüren bir ses-metin modeli, bu metni yorumlayıp uygun yanıtı hazırlayan bir dil modeli ve hazırlanan yanıtı sese çeviren bir metin-ses modeli birlikte çalışıyor. Synthesia’nın video ve ses modelleri de bu yapının içinde yer alıyor.
Şirket, müşterilerine yalnızca kendi modellerini kullanma zorunluluğu getirmiyor. Kurumsal müşteriler, Cartesia, ElevenLabs, Google veya OpenAI gibi farklı laboratuvarların sunduğu modeller arasından seçim yapabiliyor. Avatarların hangi bulut altyapısında barındırılacağı da işletmelerin tercihine bırakılıyor. İsteyen şirketler kendi bulut ortamını kullanabilirken, Synthesia’nın barındırma hizmetinden yararlanmak da mümkün.
Bu yaklaşım, teknolojinin yalnızca tanıtım amaçlı sanal karakterlerle sınırlı kalmadığını gösteriyor. Synthesia, işletmelerin yapay zekâ avatarlarıyla etkileşimli eğitim videoları hazırlamasına olanak tanıyor. Şirketin Roleplay Sessions ürünü ise çalışanların satış sunumu gibi senaryoları etkileşimli bir avatarla prova etmesini ve yanıtlarının puanlanmasını sağlıyor.
Kurumsal kullanım alanları genişliyor
Birleşik Krallık merkezli olarak kurulan Synthesia, dijital avatar alanında faaliyet gösteren girişimlerden biri. Şirket, bu yıl 4 milyar dolar değerlemeye ulaştı. Geçen yıl ise yıllık tekrarlayan gelirinin 100 milyon doları aştığını açıkladı. D-ID, HeyGen ve Colossyan gibi şirketler de benzer alanda çalışmalar yürütüyor.
Bir gazetecinin dijital ikizinin hazırlanması, teknolojinin kurumsal eğitim dışındaki kullanımını da görünür hâle getiriyor. Kişilerin kendi sesleri ve görüntüleriyle soru yanıtlayan avatarlar oluşturabilmesi, içerik üretimi, basın iletişimi ve bilgi aktarımı için farklı modellerin önünü açabilir. Bununla birlikte böyle sistemlerde kişinin avatar üretimine açıkça izin vermesi gerekiyor. Hazırlanan örnekte de avatarın oluşturulması için gazetecinin onayı alındı.
Synthesia’nın çalışması, dijital avatarların yalnızca ekranda konuşan yüzlerden ibaret olmadığını ortaya koyuyor. Ses algılama, dil işleme, ses üretimi ve video modellerinin aynı akışta birleşmesiyle kullanıcıyla karşılıklı iletişim kurabilen karakterler hazırlanabiliyor. Bu avatarın yalnızca tek bir yazı hakkında yanıt vermesi ise teknolojinin kontrol edilebilir ve belirli bir bilgi alanına bağlı biçimde kullanılabileceğini gösteriyor.
Günün zaman çizelgesi
Haber eklenme saatine göre sıralanır.
- 26 Eylül 2026
- TikTok, Alabama’daki dava için en az 100 milyon dolar ödeyecek
- Favori şarkıların davullarının ardındaki isim: Decap
- QuillCue, Siri AI için kayıtlı istemleri klavyeye taşıyor
- RØDE DS3 masaüstü mikrofon standını tanıttı
- Mark Zuckerberg’in kullandığı telefon belli oldu
- Meta, Elon Musk belgeselinin reklamlarını yayınlayacak
- Yapay zekâ ile IDM lisans koruması aşıldı
- Levoit Vital Pet Pro, evcil hayvan kokularına odaklanıyor
- Apple Watch Series 12: İlk haftada öne çıkan özellikler
- OpenAI, en güçlü yapay zekâ modellerinin eğitimini durdurdu
- Google Gemini, İşletmeleri Sizin İçin Arayabilecek
- Meta’nın 100 Gramlık 5K Micro-OLED Gözlüğünü Denedik
- Audi A6 Sportback e-tron ile 1.338 kilometrelik menzil rekoru
- The Hunt for Gollum’dan İlk Görüntüler Paylaşıldı