Çözümler

Kaynaklar

Şirket

Demo Al

Ara

Turkish

Ezber bozan modelin yeniden doğuşu: Meta AI'dan SAM 2 (Segment Anything Model 2)

SAM 2, bilgisayarla görme alanında devasa bir adım olup, hem görseller hem de videolar için son teknoloji segmentasyon ve takibi tek bir modelde bir araya getiren bir temel oluşturuyor. Bu sayede, SAM'i video segmentasyon modelleriyle birleştirme ihtiyacı ortadan kalkıyor, böylece video segmentasyonu daha basit ve sorunsuz hale gelebiliyor. Kullanıcı odaklı tasarımı ve hızlı çıkarım (inference) süreleri sayesinde SAM 2, hem erişilebilir hem de son derece verimli olacak.

SAM 2, bilgisayarla görme alanında devasa bir adım olup, hem görseller hem de videolar için son teknoloji segmentasyon ve takibi tek bir modelde bir araya getiren bir temel oluşturuyor. Bu sayede, SAM'i video segmentasyon modelleriyle birleştirme ihtiyacı ortadan kalkıyor, böylece video segmentasyonu daha basit ve sorunsuz hale gelebiliyor. Kullanıcı odaklı tasarımı ve hızlı çıkarım (inference) süreleri sayesinde SAM 2, hem erişilebilir hem de son derece verimli olacak.


Çok Yönlü Uygulamalar İçin Güçlü Gerçek Zamanlı Nesne Takibi

Bu yapay zeka harikası, sabit video kareleri boyunca nesneleri gerçek zamanlı olarak pürüzsüzce takip ediyor, böylelikle çok sayıda video düzenleme uygulaması ile artırılmış gerçeklik içeren uygulamaların kapılarını açıyor. İlki olan Segment Anything Model (SAM) başarısının üzerine kurulan SAM 2, özünde bilgisayarla görme sistemlerini eğitmek amacıyla görsel verileri etiketlenebilir hale getirmek için üstün performans ve verimlilikten yararlanıyor. Bu durum, canlı veya gerçek zamanlı bir video üzerindeki nesnelerin seçilmesi ve onlarla etkileşim kurulması bakımından yenilikçi yollar açıyor.


SAM 2's impressive zero-shot segmentation capabilities demonstrated across various scenes and objects, showcasing its potential for real-time video analysis, augmented reality applications, and more.


SAM 2'nin Temel Özellikleri

Nesne Seçimi ve Ayarlaması: SAM'in istem tabanlı nesne bölütlemesini, video kareleri boyunca nesne takipleri üzerinde çalışacak şekilde genelleştirir.

Tanıdık Olmayan Videoların Güçlü Bölütlenmesi: Görülmemiş alanlardaki nesneleri, görüntüleri ve videoları bölütlemek için sıfır-atışlı (zero-shot) genelleme, onu çeşitli gerçek dünya uygulamaları için kullanışlı kılar.

Gerçek Zamanlı Etkileşim: Bellek akışı mimarisi, video karelerini tek tek işleyerek gerçek zamanlı etkileşime olanak tanır.

Performans İyileştirmeleri

SAM 2, video ve görüntü bölütlemede yeni bir standart belirliyor. Video bölütlemede daha doğru sonuçlar verdiği, etkileşim sayısının üç kat azaldığı ve video etiketlemelerinin 8 kat hızlandığı kanıtlanmıştır. Görüntü bölütlemede de önceki modele göre daha doğrudur ve öncülü SAM'den altı kat daha hızlıdır.


SAM 2

SAM 2 (Hiera-B+ ve Hiera-L), MOSE, DAVIS, LVOS, SA-V ve YTVOS gibi çeşitli video nesnesi bölütleme kıyaslamalarında mevcut en modern (SOTA) modellerden daha iyi performans gösterirken rekabetçi bir çıkarım hızını da korur.

Zero-shot accuracy over 9 datasets in interactive offline and online evaluation settings

Meta AI, SAM 2'nin etkisinin basit video bölütlemenin ötesine geçtiğine dikkat çekiyor: "Verilerimizin, modelimizin ve içgörülerimizin video bölütleme ve ilgili algılama görevleri için büyük bir dönüm noktası olacağına inanıyoruz."


SAM 2'deki Mimari Yenilikler

Kare Katıştırmaları ve Bellek Koşullandırma: Bu özellik, SAM 2'nin kare katıştırmalarını önceki karelerin ve istem karelerinin çıktılarına göre koşullandırmasını sağlar, böylece nesnelerin geçmişini ve hareketini anlayabilir.

The architecture of SAM 2, illustrating the flow of image and prompt embeddings through the image encoder, mask decoder, and various attention mechanisms to generate object masks and associated confidence scores.

Nesne maskelerini ve ilgili güven puanlarını oluşturmak için görüntü ve istem katıştırmalarının görüntü kodlayıcı, maske kod çözücü ve çeşitli dikkat mekanizmaları aracılığıyla akışını gösteren SAM 2 mimarisi.


Bellek Kodlayıcı ve Bellek Bankası: Mevcut tahmine dayalı olarak kare belleğini yönetir ve bunu bir FIFO (ilk giren ilk çıkar) kuyruğunun uygulandığı bellek bankasında saklar. Çok kısa vadeli zamansal konum bilgisi, son karelerin belleklerine dahil edilir, böylece kısa vadeli nesne hareketi yakalanır.

Görüntü Kodlayıcı: Video karelerini sırasıyla işleyen ve her karenin çok ölçekli özellik katıştırmalarını oluşturan bir görüntü kodlayıcıdır.

Bellek Dikkat Mekanizması: Geçmişi ve bağlamı etkili bir şekilde birleştirerek, bir dizi transformer bloğu aracılığıyla mevcut kare özelliklerini geçmiş kare özelliklerine, tahminlere ve yeni istemlere göre koşullandırır.

Re-birth of the game changer: SAM 2 (Segment Anything Model) 2 by Meta AI 1722858154408

SAM 2'nin mimarisi, kareler arasında zamansal tutarlılığı koruyarak videolarda gerçek zamanlı nesne takibi ve bölütlemesini mümkün kılar. Nesne maskeleri oluşturmak için görüntü ve istem katıştırmalarını, bellek dikkat mekanizmasını ve maske kod çözücüsünü kullanır.


Teknik Eğitim ve Veri Kümesi

SAM 2, Hiera görüntü kodlayıcısının ön eğitim MAE'si ile önceden eğitilmiş SA-1B üzerinde ince ayarlardan geçirilmiştir. Dedektörler, görüntünün %90'ından fazlasını kaplayan maskeler filtrelenerek ve SA-V+Dahili ile SA-1B dahil olmak üzere tam eğitim karışımları ile DAVIS, MOSE ve YouTubeVOS gibi açık kaynaklı yapay zeka video veri kümelerinin yanı sıra rastgele örneklenen 64 maske üzerinde eğitilerek üst yapıya entegre edilmiştir. Dolayısıyla, bu tam eğitimli yaklaşım, video kareleri boyunca etkili bölütleme ve takibi garanti etmenin yanı sıra etkileşimli iyileştirmelere olanak tanır.

Bu SA-V veri kümesi, 47 ülkeden elde edilen yaklaşık 51.000 videodan çıkarılan yaklaşık 600.000'den fazla maske parçasına (masklet) sahiptir. Bu durum, veri kümesinin güçlü model performansı için gerçekçi ortamları taklit etme yeteneğini gösterir.


SAM 2'nin Sınırlılıkları

Çekim Değişiklikleri Boyunca Bölütleme: SAM 2, video çekimlerindeki değişiklikler boyunca nesne bölütlemesini sürdürmekte zorlanabilir.

Kalabalık Sahneler: Model, yoğun nüfuslu sahnelerde nesnelerin takibini kaybedebilir veya nesneleri karıştırabilir.

Uzun Süreli Kapanmalar: Uzun süreli tıkanmalar (nesnenin görünmemesi durumu), hatalara veya nesne takibinin kaybına yol açabilir.

İnce Detaylar: Özellikle hızlı hareket ettiklerinde, çok ince veya hassas detaylara sahip nesnelerde zorluklar yaşanmaktadır.

Nesneler Arası İletişim: SAM 2, paylaşılan nesne düzeyinde bağlamsal bilgi olmadan birden fazla nesneyi ayrı ayrı işler.

Kalite Doğrulaması: Maske parçası (masklet) kalitesini doğrulamak ve hataları düzeltmek için şu anda insan etiketleyicilere olan bağımlılık otomasyonla iyileştirilebilir.

Umut verici olmakla birlikte SAM 2, şüphesiz ki görüntü düzeyinde bölütlemeyi geride bırakarak AR, VR, robotik, otonom araçlar, video düzenleme ve doğru zamansal konumlandırmanın gerekli olduğu diğer pek çok uygulama alanında bir devrim yaratıyor. Bu kullanılabilirlik geliştirmesinin ardından, video nesnesi bölütleme çıktılarının modern video oluşturma modellerine girdi olarak kullanılması ve böylece hassas düzenlemenin mümkün olması umulabilir. Gerçek zamanlı veya canlı video bağlamında yaratıcı etkileşimleri teşvik etmek amacıyla yeni girdi istemi türleriyle genişletmeye izin verilebilir.

SAM 2, birçok video ve görüntü bölütleme görevinde en iyi doğruluğa, en iyi verimliliğe sahiptir ve en hızlısıdır. Gerçek zamanlı etkileşim ve bu tür görevlerdeki güçlü performans, SAM 2'nin kolayca geliştirebileceği alanlardan bazıları olacak ve farklı sektörlerdeki deneyimleri dönüştürmeyi vaat edecektir. Şu anda SAM 2, Apache 2.0 lisansı altında sunulduğu için özetle, yapay zeka topluluğu genelinde bilgisayarla görme sistemlerindeki inovasyon ve gelişim sınır tanımayacaktır. GitHub deposuna olan bağlantı burada bulunabilir.