Eş zamanlı yapay zekâ: Güvenin son kalesi yıkılıyor
Görüntülü görüşmelerin son güven kalesi de yıkılıyor. Tavus’un Griffin modeli, insan tepkilerini milisaniyeler içinde taklit ederek yapay zekâyı “canlı” hissettiriyor. Peki gözümüzün gördüğüne ve sesimizin duyduğuna artık güvenebilir miyiz?
İnternet dünyasının yazılı olmayan ama herkesin güvendiği tek bir altın kuralı vardı: Şüpheye düşersen, görüntülü ara. Karşımızdaki kişinin bir dolandırıcı, bir bot veya bir "deepfake" illüzyonu olup olmadığını anlamanın son kalesi, onunla göz göze gelip anlık tepkilerini ölçebilmekti. Ancak geçtiğimiz günlerde yayınlanan kısacık bir deney videosu, bu son kalenin de sessizce düştüğünü ilan etti. Tavus adlı girişimin geliştirdiği "Griffin" modeli, ekrandaki yüzün sadece gerçeğe benzemesiyle yetinmiyor; sizinle aynı anda nefes alıyor, siz konuşurken başını sallıyor ve en ürkütücüsü, sözünü kestiğinizde anında duraksayıp reaksiyon gösteriyor. Şirketin 54 kişiyle yaptığı ufak çaplı Turing testi denemesinde, katılımcıların neredeyse yarısı karşılarındaki makineyi kanlı canlı bir insan sanarak görüşmeyi tamamladı. Mesele artık sadece yüzleri statik olarak kopyalamak değil; yapay zekâ artık "orada bulunma" (presence) hissini, yani iletişim kurmanın o kaotik ve eş zamanlı ritmini simüle ediyor.
Milisaniyelik illüzyon: Reaktif çoklu modalite
Bu illüzyonu bu kadar inandırıcı kılan şey, perdenin arkasında dönen sıradan bir yazılım hilesi değil, donanım ve yazılım sınırlarını sonuna kadar zorlayan bir reaktif çoklu modalite (multimodality) başarısıdır. Bugüne kadar bildiğimiz yüksek kaliteli üretken yapay zekâ video araçları asenkron çalışıyordu. Sisteme bir metin veya komut giriyordunuz ve sunucular o görüntüyü oluşturmak (rendering) için dakikalar harcıyordu. Griffin modelinde ise asıl teknolojik sıçrama, iletişimdeki gecikme (latency) engelinin insanın algı sınırlarının altına, milisaniyeler seviyesine çekilmiş olmasıdır.
Karşınızdaki dijital siluet, bir video kaydı oynatmıyor. Algoritmalar anlık olarak sizin ses tonunuzu ve sessizliğinizi dinliyor. Konuştuğunuz anda sesiniz anında metne dökülüyor (Speech-to-Text), devasa bir dil modeli o metne uygun bağlamsal bir cevap üretiyor (LLM), bu metin yeniden insan doğallığında bir sese dönüştürülüyor (Text-to-Speech) ve tüm bu veri zinciri, ekrandaki yüzün kas hareketlerine eş zamanlı olarak işleniyor. Üstelik sistem sadece konuşmaya değil, sessizliğe de tepki veriyor; model o anki dinamiğe göre sandalyesinde kıpırdanma veya gülümseme kararı alabiliyor. İnsan beyni, karşısındakinin gerçekliğini dudak senkronizasyonundaki milimetrik hatalardan ziyade, iletişimin bu anlık reflekslerinde arar. Sistem tam olarak bu bilişsel zaafımızı hackleyerek, siber güvenlikte doğrudan insan psikolojisini hedef alan yepyeni bir cephe açıyor.
İstatistiksel bir göz boyama mı?
Öte yandan, şirketin “%48 oranında Turing testini geçtik” iddiası ilk bakışta teknolojik bir zafer gibi görünse de analitik bir gözle incelendiğinde ortada zekice kurgulanmış bir istatistiksel illüzyon yatıyor. Sadece 54 kişiyle ve en fazla birer dakikalık görüşmelerle sınırlı kalan bu testin asıl dayanağı algoritmalar değil, insan psikolojisi. Deneyde katılımcılara karşılarında bir insan olacağı önceden söylenerek zihinleri bir "psikolojik hazırlama" (priming) sürecine sokuldu. İnsan beyni, başından itibaren güvenmeye yönlendirildiğinde, görüntüdeki ufak tefek tutarsızlıkları kendi algısıyla doldurmaya son derece meyillidir. Bir makineyi yakalamaya çalışmak ile bir insanla konuştuğuna inanmak, tamamen farklı bilişsel durumlardır.
Peki bu görüşme bir dakika değil de on dakika sürseydi ne olurdu? Süre uzadıkça, modelin arkasındaki devasa veri işleme yükü birikecek ve işlemci darboğazları (bottlenecks) kaçınılmaz olarak kendini gösterecekti. Ağız senkronizasyonunda (lip-sync) yaşanacak milisaniyelik bir kare atlaması, mikro-göz hareketlerindeki mekaniklik veya robotik biliminde "tekinsiz vadi" (uncanny valley) olarak adlandırılan o soğuk donukluk, yaratılan illüzyonu bir anda çökertebilirdi.
Sosyal mühendisliğin yeni çağı
Yine de bu teknolojik kusurlar, kapımızdaki tehlikenin boyutunu küçültmüyor. Siber güvenliğin ve sosyal mühendisliğin bu yeni çağında, bir yapay zekânın herkesi her an kandıracak kadar kusursuz olmasına gerek yok. Doğru kişiyi, doğru zamanda ve yeterince stresli bir anda, sadece birkaç dakikalığına kandırması yeterli. Haftalarca sizinle yazışan, espri anlayışınızı öğrenip güveninizi kazanan bir profilin, bir gün telaşlı bir şekilde sizi görüntülü arayarak acil para transferi istediğini düşünün. Ya da bir şirket çalışanının, ekranın karşısında doğrudan kendi yöneticisini "canlı ve kanlı" bir şekilde görerek kritik ağ erişim şifrelerini teslim ettiğini hayal edin.
Bugün o kusursuz eşik tamamen aşılmamış, ufak tefek mimik hataları yapay zekâyı ele veriyor olabilir. Ancak teknolojinin ivmesi göz önüne alındığında, "Kendi gözlerimle gördüm, kendisiyle konuştum" cümlesinin mahkemelerde, bankalarda veya ikili ilişkilerde hiçbir geçerliliğinin kalmayacağı bir dünyaya resmen adım atmış bulunuyoruz.

Olmak ya da Olmamak - Tiyatro, Hayat ve İnsan
Sanatın 6. dalı tiyatro, sahnede sadece bir oyun sunmuyor aynı zamanda hayatı ve insanı da anlatıyor. Dünyaca ünlü yazar William Sheakspeare’nin “Olmak ya da olmamak, işte bütün mesele bu” sözünden ilham aldığımız podcast serimizde; tiyatroyu, alanının uzman isimleriyle konuşuyoruz..

Spor Sohbetleri
"Spor Sohbetleri" ile spor dünyasının nabzını tutmaya hazır mısınız? Her bölümde farklı bir konuyu ele alarak, sporun tarihini, kültürünü ve güncel olaylarını mercek altına alıyoruz. Taktik teknikten ziyade sporun toplumsal etkilerini masaya yatıyoruz. Eğer siz de sporun sadece spor olmadığına inananlardansanız "Spor Sohbetleri" tam size göre.