vLLM vs LLM: LLM Sunumunda Yeni Dönem

vLLM'in geleneksel LLM'lerden farkı nedir?
vLLM'lere dalmadan önce, bildiğimiz şekliyle LLM modellerinin ve bunların bellek sistemlerinin nasıl çalıştığını anlamak çok önemlidir. LLM'lerin merkezinde, girişe (veya isteme) ve şimdiye kadar ürettiği çıktının önceki belirteç dizisine dayanarak her defasında bir belirteç (token) üretmek için otoregresif bir kod çözücü kullanan bir Transformers modeli bulunur. Her istek için, model bir sonlandırma belirteci döndürene kadar belirteç üretimi gerçekleştirilir. Makale, bu dizinin süreci bellek sınırına maruz bıraktığını, bunun da GPU'ların hesaplama yeteneklerini yetersiz kullandığını ve hizmet verimini sınırladığını ileri sürmektedir. Belleğin yarısından fazlası statik olan model ağırlıkları tarafından kaplanırken, daha küçük bir kısmı isteklerin dinamik durumları tarafından kaplanır. Transformers'ta bu dinamik durumlara, genellikle önceki belirteçlerin bağlamını temsil eden KV önbelleği olarak adlandırılan, dikkat mekanizmasıyla ilişkili anahtar ve değer (key and value) tensörleri denir. KV önbelleği, üretilen belirteç sayısına bağlı olarak zaman içinde dinamik olarak büyüyen ve küçülen bir yapıdır. Verimli bir şekilde yönetilmediğinde bu durum sınırlı toplu iş (batch) boyutuna ve dolayısıyla daha düşük verime yol açar. Genel olarak mevcut sistemler iki büyük verimsizlik nedeniyle engellenmektedir; ilki iç ve dış bellek parçalanması (fragmentation), ikincisi ise bellek paylaşımı fırsatlarından yararlanılamamasıdır.
vLLM bu darboğazları yeni bir teknik sunarak çözüyor: PagedAttention. İşletim sistemlerindeki sayfalama (paging) özellikli sanal
bellek kavramından ilham alan PagedAttention, anahtar ve değer tensörlerinin bitişik olmayan şekilde depolanmasını sağlayarak geleneksel dikkat mekanizmalarından ayrılır. KV önbelleğini tek bir sürekli yığın olarak depolamak yerine, her biri belirli sayıda belirteci temsil eden sabit boyutlu bloklara böler. Dikkat işlemi gerçekleştirilirken, PagedAttention çekirdeği hesaplama için gereken ilgili KV bloklarını verimli bir şekilde bulur ve getirir.
Dahası, vLLM çeşitli boyutlarda GPT, OPT, LLaMA gibi popüler LLM'leri destekler ve makalede yapılan değerlendirmelere göre vLLM, model doğruluğu üzerinde hiçbir olumsuz etki yaratmadan LLM hizmet verimini son teknoloji LLM'lere kıyasla 2-4 kat artırır.
vLLM, aynı istemden birden fazla çıktı dizisinin üretildiği paralel örneklemede önemli bir avantaj sağlar; bu durumda istem için yapılan hesaplama ve bellek çıktı dizileri arasında paylaşılabilir. vLLM bu paylaşımı kolayca gerçekleştirebilir ve bellek tasarrufu sağlayabilir. Benzer şekilde vLLM, paralel ışın işleme yoluyla ışın aramasında (beam search) daha yüksek verimlilik, veri akışı hızı ve daha düşük gecikme süresi sağlamıştır.
Kıyaslama Karşılaştırması: vLLM, Hugging Face Transformers ve TGI Karşılaştırması
vLLM geliştiricileri, vLLM'in veri akışı hızını Hugging Face Transformers ve Text Generation Inference (TGI) ile karşılaştırmış ve vLLM'in HF'ye kıyasla 24 kata kadar daha yüksek veri akışı hızı, TGI'ye kıyasla ise 3,5 kata kadar daha yüksek veri akışı hızı elde ettiğini görmüşlerdir. Bu sonuçlar, vLLM'in LLM çıkarımı (inference) ve hizmetindeki performansı nasıl kökten değiştirdiğini vurgulamaktadır. Transformers yüksek verim sağlamaz ve bunlar vLLM blogu tarafından sağlanan görselde görüldüğü gibi vLLM hizmetinin gerisinde kalan TGI tarafından iyileştirilir.
vLLM'ler için kullanım senaryoları
Elde edilen performans artışı seviyesi, vLLM'i yüksek veri akışlı üretim
ortamları için ideal kılmaktadır, örneğin:
● RAG sistemleri
● Sohbet robotu (Chatbot) ve sanal asistanlar
● İçerik üretimi
● Otomatik çeviri
Kapanış konuşması
vLLM, çıkarım sırasında bellek ve hesaplamanın nasıl yönetildiğini yeniden düşünerek öne çıkıyor. PagedAttention yeniliği sayesinde veri akışı hızını, yanıt verebilirliği ve kaynak verimliliğini önemli ölçüde artırır. Ölçeklenebilir, verimli çıkarım talebi artmaya devam ettikçe, vLLM'lerin LLM dağıtımının geleceğinde giderek daha büyük bir rol oynamaya hazır olduğunu söylemek yanlış olmayacaktır.




