Google, metin, kod, görüntü, video ve ses verilerini aynı sistemde işleyebilen açık kaynaklı EmbeddingGemma 2 modelini duyurdu. 740 milyon parametreli model, internet bağlantısı olmadan cihazlarda çalışacak şekilde tasarlandı.
Metin, görüntü, video ve sesi birlikte işliyor
EmbeddingGemma 2, farklı veri türlerini sayısal vektörlere dönüştürerek aralarında anlamsal ilişki kurulmasını sağlıyor. Bu sayede bir ses kaydındaki ifadeyle bağlantılı video görüntüsü bulunabiliyor ya da uzun ses kayıtları metinle aranabiliyor.
Google’ın geçen yıl yayımladığı ilk EmbeddingGemma yalnızca metne odaklanıyordu. Yeni sürüm ise metnin yanı sıra kod, görüntü, video ve ses desteği sunuyor. Gemma 4 mimarisini temel alan model, Apache 2.0 lisansıyla dağıtılıyor ve çalışmak için internet bağlantısı gerektirmiyor.
Modelin toplam kapasitesi 740 milyon parametre. Ancak kullanım senaryosuna göre yalnızca ilgili bölümün çalıştırılması mümkün: Metin işlemleri için 270 milyon, görüntü için 170 milyon ve ses için 300 milyon parametreli yapı kullanılabiliyor.
Vektör boyutunu küçülterek kaynak kullanımını azaltıyor
EmbeddingGemma 2, Matryoshka Representation Learning (MRL) yöntemiyle ürettiği 768 boyutlu vektörleri 512, 256 veya 128 boyuta indirebiliyor. Google, bu esnekliğin özellikle cihaz üzerindeki vektör veritabanlarında depolama alanı ve bellek kullanımını 6 kata kadar azaltabileceğini belirtiyor.
Modelin bağlam penceresi 8 bin token. Bu kapasite, önceki EmbeddingGemma’nın sunduğunun dört katı. Google’ın verdiği bilgilere göre model, yerel donanımda yaklaşık 5,5 dakikalık ses, 29 görüntü veya 58 video karesini işleyebiliyor.
Pixel 11 Pro’da 191 MB RAM kullanıyor
Yerel yapay zekâ uygulamaları için optimize edilen model, Google’ın açıklamasına göre Pixel 11 Pro’da yalnızca metin işlemleri için yaklaşık 191 MB aktif RAM’e ihtiyaç duyuyor. Diğer veri türleri de hesaba katıldığında aktif bellek kullanımı yaklaşık 567 MB’a çıkıyor.
EmbeddingGemma 2, WebGPU aracılığıyla tarayıcıda da çalıştırılabiliyor. Google, bu kullanımda sorguların yaklaşık 20 ila 70 milisaniyede işlenebildiğini aktarıyor. İşlemler için uzak sunucuya sorgu gönderilmesi veya API anahtarı kullanılması gerekmiyor.
Verilerin cihazda işlenmesi, kişisel bilgilerin cihaz dışına çıkarılmasını önlemeyi amaçlıyor. Yerel embedding işlemi ayrıca ağ gecikmesini ortadan kaldırarak çevrimdışı arama ve verilere erişim imkânı sağlıyor.
Model ağırlıkları Hugging Face ve Kaggle’da
EmbeddingGemma 2’nin model ağırlıkları Hugging Face ve Kaggle üzerinden erişime açıldı. Gemini Enterprise Agent Platform Model Garden desteğinin daha sonra sunulması planlanıyor. Cihaz üzerinde kullanım için optimize edilen modeller, LiteRT Community’nin Hugging Face sayfasında da bulunuyor.