lokale KI: llama.cpp als server

OP #8087629
Lesenswert?

Mittlerweile habe ich llama.cpp als Modellserver laufen und man kann die verschiedenen Modelle auswählen.

1
./llama-server --host 0.0.0.0 --port 30000

Falls sich da an den Files auf hugging-face etwas ändert, scheint es das jeweilige gesamte Modell neu herunterzuladen. Je nach Modell sind das dann mal locker 30GB und man muss ewig warten. Kann man irgendwie verhindern, dass die Modelle automatisch "upgedatet" werden?

Antwort schreiben

Bitte melde dich an, um einen Beitrag zu schreiben.

oder

Mit Google-Account einloggen

Die Registrierung ist kostenlos und dauert nur eine Minute.

Jetzt registrieren