Mittlerweile habe ich llama.cpp als Modellserver laufen und man kann die verschiedenen Modelle auswählen.
1 |
|
Falls sich da an den Files auf hugging-face etwas ändert, scheint es das jeweilige gesamte Modell neu herunterzuladen. Je nach Modell sind das dann mal locker 30GB und man muss ewig warten. Kann man irgendwie verhindern, dass die Modelle automatisch "upgedatet" werden?