AMD, yapay zeka modellerini silikon içine doğrudan gömmeye odaklanan Kanadalı startup Taalas'ı satın almıştır. Taalas'ın teknolojisi model ağırlıklarını (weights) doğrudan çıkarsama (inference) çipine kodlamakta, bu yöntem her çipi tek bir modele bağlı kılarken son derece yüksek performans sağlamaktadır.
Şirketin demo çipinin Llama 3.1-8B modelini çalıştırırken kullanıcı başına saniyede 16.000 tokeni aşan çıkarsama hızına ulaştığı bildirilmektedir. Bu yaklaşım, model ağırlıklarının hafızadan okunması gereken geleneksel yönteme kıyasla, hesaplama-hafiza bant genişliği darboğazını ortadan kaldırarak hızı önemli ölçüde artırmaktadır.
Google'ın Gemini için benzer bir yaklaşım üzerinde çalıştığı rapor edilmektedir. Bu trend, özel amaçlı çıkarsama donanımı ve sabit model yapılandırmaları içeren uygulamalar için optimize edilmiş silikon tasarımına doğru bir kaymayı işaret etmektedir.






