Taalas bietet ein in Silizium gegossenes Llama 3.1 8B KI-Modell an, mit dem man mal selbst probieren kann, was für eine extreme Geschwindigkeit man mit in Silizium gegossenen Modellgewichte erreicht: 15.000 Token/s.
Zum selbst ausprobieren gibt es einen Link zum ChatBot auf der Seite:
Die Geschwindigkeit ist ziemlich krass, auch wenn ein 3.1 Modell ziemlich veraltet ist.

