KI Modellgeschwindigkeit verschiedene Hardware

#8074560
Lesenswert?

Im Moment teste ich gerade, wie schnell das Modell gemma-4-E2B

https://huggingface.co/unsloth/gemma-4-E2B

auf verschiedener Hardware mit llama.cpp läuft:

CPU only, Ryzen 7 5700G: ~10 token/sec RTX5060: 94 token/sec SparkDGX: 83 token/sec

Erstaunlich: die DGX ist leicht langsamer als die RTX5060 .. warum?

#8074577
Lesenswert?

Ryzen 5700G iGPU (Ollama mit Vulkan-Backend)

1
total duration:       1m1.516410286s
2
load duration:        698.760263ms
3
prompt eval count:    42 token(s)
4
prompt eval duration: 304.425ms
5
prompt eval rate:     137.97 tokens/s
6
eval count:           1357 token(s)
7
eval duration:        1m0.507372s
8
eval rate:            22.43 tokens/s

ollama run --verbose gemma4:e2b environment: - OLLAMA_VULKAN=1 - OLLAMA_IGPU_ENABLE=1

Christoph M. schrieb:

Erstaunlich: die DGX ist leicht langsamer als die RTX5060 .. warum?

der Vorteil der DGX ist das viele RAM. Wenn du ein kleines Model testest, spielt das keine Rolle.

: Bearbeitet durch User
#8074617
Lesenswert?

Εrnst B. schrieb:

eval rate: 22.43 tokens/s

Interessant, mit Vulkan scheint das den Faktor 2 auszumachen. Mein Benchmark oben ist aber mit llama.cpp, von dem einige behaupten, es würde auch noch mal etwas Performance gegenüber ollama rausholen. Ob das stimmt?

Εrnst B. schrieb:

der Vorteil der DGX ist das viele RAM. Wenn du ein kleines Model testest, spielt das keine Rolle.

Anzahl der Cuda-Cöre und Tensor-Cöre sowie Speicherbandbreite sollten aber auch eine Rolle spielen, meine ich. Meines Wissens hat die RTX5060 da auch nur die halbe Speicherbandbreite gegenüber der RTX5070.

#8074734
Lesenswert?

Christoph M. schrieb:

Anzahl der Cuda-Cöre und Tensor-Cöre sowie Speicherbandbreite sollten aber auch eine Rolle spielen, meine ich.

Wenn die Speicherbandbreite nicht reicht, drehen die vielen Recheneinheiten Däumchen.

der Spark hat so ~275Gb/sec, LPDDR5, aber VIEL davon. die 5060 hat ~450Gb/sec, GDDR7@128Bit, aber eben nur 8GB davon.

Hätte erwartet, dass die RTX5060 da viel mehr Vorsprung vor dem SparkDGX rausholt, wenn das Model komplett im GDDR7 liegt.

#8074785
Lesenswert?

Manfred L. schrieb:

Modellgeschwindigkeit messen?

Modell im Kommandozeilenmodus laufen lassen (hier gemma4:e4b), dann "/set verbose" eingeben:

1
 
2
user@Ryzen7:~$ ollama run gemma4:e4b
3
>>> /set verbose
4
Set 'verbose' mode.
5

6
>>> hello
7

8
Hello! How can I help you today? 😊
9

10
total duration:       2.613951365s
11
load duration:        355.39509ms
12
prompt eval count:    17 token(s)
13
prompt eval duration: 72.562ms
14
prompt eval rate:     234.28 tokens/s
15
eval count:           180 token(s)
16
eval duration:        2.1834s
17
eval rate:            82.44 tokens/s

(Beispiel für Linux, wie das in Windows geht, weiß ich nicht)

Zeige doch mal das Ergebnis.

: Bearbeitet durch User
#8074805
Lesenswert?

Hallo,

danke, ich habe die Befehle in die PowerShell eingegeben und habe folgendes bekommen: (für gemma4:e4b)

total duration: 677.9807ms load duration: 157.0277ms prompt eval count: 17 token(s) prompt eval duration: 151.5652ms prompt eval rate: 112.16 tokens/s eval count: 11 token(s) eval duration: 201.5275ms eval rate: 54.58 tokens/s

Bei den Wiederholungen gab es:

Hello again! How are you doing? 😊

total duration: 4.9303335s load duration: 4.6620976s prompt eval count: 38 token(s) prompt eval duration: 26.8366ms prompt eval rate: 1415.98 tokens/s eval count: 10 token(s) eval duration: 88.3746ms eval rate: 113.15 tokens/s

Hello! I'm here if you need anything at all. What's on your mind today? 😊

total duration: 644.0134ms load duration: 175.6381ms prompt eval count: 58 token(s) prompt eval duration: 178.2459ms prompt eval rate: 325.39 tokens/s eval count: 23 token(s) eval duration: 273.8382ms eval rate: 83.99 tokens/s

Die Grafikkarte (RTX 5090 mobile) hat 13,6 GB genutzt.

Nach exit kam:

Have a wonderful day! Goodbye! 👋

total duration: 7.4143416s load duration: 4.6218245s prompt eval count: 91 token(s) prompt eval duration: 30.8618ms prompt eval rate: 2948.63 tokens/s eval count: 293 token(s) eval duration: 2.4736513s eval rate: 118.45 tokens/s

MfG egonotto

: Bearbeitet durch User
#8074816
Lesenswert?

Hallo,

nun hab ich folgendes probiert:

PS C:\Windows\system32> ollama run llama3.3:70b

hello Hello! It's nice to meet you. Is there something I can help you with or would you like to chat?

/set verbose Set 'verbose' mode. hello Hello again! It seems like we're having a very friendly and repetitive conversation so far. Would you like to break the ice and talk about something specific, or just enjoy the hello's for a bit longer? 14,7 total duration: 35.4693132s load duration: 76.2597ms prompt eval count: 46 token(s) prompt eval duration: 2.2488908s prompt eval rate: 20.45 tokens/s eval count: 43 token(s) eval duration: 33.1142414s eval rate: 1.30 tokens/s

Es braucht 46,7 GB GPU Speicher wobei nur 14,7 GB von der Grafikkarte genommen wird.

MfG egonotto

#8074922
Lesenswert?

Εrnst B. schrieb:

Hätte erwartet, dass die RTX5060 da viel mehr Vorsprung vor dem SparkDGX rausholt, wenn das Model komplett im GDDR7 liegt.

Das könnte daran liegen, dass nicht alles auf der GPU läuft sondern ein nicht unerheblicher Teil auf der CPU und diese dann über den "dünnen" Bus meines AM4 Boards mit der GPU kommunizieren muss. Bei mir ist ein Kern der CPU zu 100% ausgelastet, wenn das Modell läuft. Hier wäre es interessant zu sehen, wie schnell es läuft wenn jemand ein AM5 Board mit DDR5 und einer RTX5060 hat.

Ich mache meine Tests im Moment mit llama.cpp. Wenn man in den Code schaut, sieht man, dass dort die Modelle relativ kurz in C++ kodiert sind:
https://github.com/ggml-org/llama.cpp/tree/master/src/models
Die Gigabyte großen Files mit den Gewichten müssen getrennt von dieser Modellbasis heruntergeladen werden. Daraus ergibt sich eine interessante Erkenntnis: Man kann darauf nur die von Unsloth oder Hugging Face heruntergeladenen Modelle laufen lassen, wenn in der Codebasis schon die passende Modellstruktur vorhanden ist. Das bedeutet: Wenn es neue Modelle mit anderen Strukturen gibt, muss man llama.cpp updaten.

#8074925
Lesenswert?

CPU only, Ryzen 7 5700G: ~10 token/sec

Ist das DDR4 oder 5? Und was wuerde das ausmachen?

Bin auch gerade am ueberlegen aufzuruesten. Problem ist nur die Grafikkarten haben maximal 32GB, also eher zu wenig und sind dann mit 4000Euro schon relativ teuer. Kann man eigentlich zwei solche Karten reinstecken und zusammen arbeiten lassen? Wie skaliert das dann?

Oder lieber auf Geschwindigkeit verzichten und den PC auf 128GB bringen. Zwar langsamer, aber intelligenter.

Ich hab mich erst mal entschieden meinen Rechner nur auf 48GB aufzuruesten, also die arme Leute Loesung und dann in 2-3Jahren eine Grafikkarte mit 64GB Vram zu kaufen. Ich denke sobald die ganzen KI-Rechenzentren zusammengebrochen sind weil sie merken das wir KI lieber lokal halten wollen, wird die Hardware wieder etwas billiger werden.

BTW: Da mein Rechner natuerlich mikrosoftfreie Zone ist lege ich eigentlich Wert darauf nichts von NVidia zu kaufen, wie machen sich AMD in dem Zusammenhang? Hat da einer bereits Erfahrungen?

Vanye

#8075123
Lesenswert?

Vanye R. schrieb:

Da mein Rechner natuerlich mikrosoftfreie Zone ist lege ich eigentlich Wert darauf nichts von NVidia zu kaufen, wie machen sich AMD in dem Zusammenhang? Hat da einer bereits Erfahrungen?

Kleiner Fun-Fact am Rande: AMD-Chefin Lisa Su und Nvidia-Chef Jensen Huang sind miteinander verwandt. Sie sind Großcousine und Großcousin. Nachzulesen im sehr empfehlenswerten Buch "The Thinking Machine: Jensen Huang, Nvidia, and the World's Most Coveted Microchip". Dort steht auch, wie Jensen CUDA über Jahre mit Millionenaufwand entwickeln lies und dafür fast als CEO von einer Investmentfirma abgesetzt wurde. AMD hat das nicht gemacht und versucht ROCM gleichzuziehen, indem sie Open-Source Entwickler dafür einspannen um irgendwie den Rückstand aufzuholen.
https://github.com/ROCm/rocm

Nur leider hinken sie NVIDIA dabei um einiges hinterher, die CUDA so eng mit ihrer Hardware verzahnt haben und gar nicht mehr alle Hardwaredetails offen legen, sodass man für die KI-Beschleuniger CUDA verwenden muss.

Llama.cpp kann man scheinbar für ROCM compilieren und muss nicht zwingend den Vulkan-Treiber nehmen:
(leider muss ich den link als Screenshot posten, weil MC-net denkt, es wäre Spam)

Angehängte Dateien:
#8075203
Lesenswert?

Hallo,

nun habe ich qwen3.5:122b probiert. Braucht nur so 22 GB Grafikspeicher, aber 65 GB RAM.

total duration: 8m14.6080928s load duration: 121.6065ms prompt eval count: 237 token(s) prompt eval duration: 5.672761s prompt eval rate: 41.78 tokens/s eval count: 1719 token(s) eval duration: 8m7.6324113s eval rate: 3.53 tokens/s

Meine Eingabe war: "Im deutschsprachigen Raum erschienen Anfang der sechziger Jahre zwei Buchtitel mit Abenteuergeschichten, nämlich Casey Jones der Lokomotivführer. Für die Jugend erzählt und Casey Jones fährt wieder, beide von der Autorin Margret Haas."

MfG egonotto

#8075296
Lesenswert?

Manfred L. schrieb:

mit qwen3.6:35b bekomme ich:

Ich denke, man müsste zu jedem Benchmark die Hardwarespecs mit angeben und als Ergebnis reicht eigentlich die "eval-rate in token/sec".

Mein System ist:
CPU: Ryzen 7 5700G (G: Radeon iGPU) RAM: 32GB DDR4 GPU: RTX5060 VRAM: 8GB GDDR7@128Bit VRAM Transfer: ~450Gb/sec

Versucht mal, deine genauen Systemspecs herauszufinden.

#8075329
Lesenswert?

Mal das Notebook ausgepackt, Ryzen AI 9 365, 32GB Ram

Gemma-4-e4b iGPU: 24.5 TPS (ca. 50 Watt) NPU: 11.8 TPS (ca. 10 Watt) CPU: 20.5 TPS (ca. 50 Watt)

Stromverbrauch aus dem Energiemonitor bei Batteriebetrieb ausgelesen, ca. 10 Watt für "idle desktop" abgezogen. Also nur grober Schätzwert, und vermutlich sind iGPU und CPU thermisch limitiert.

Zweiter Lauf am Netzteil hatte fast dieselben Werte.

War mein erster Versuch mit der NPU, vielleicht hab ich da auch was falsch konfiguriert.

#8075542
Lesenswert?

Manfred L. schrieb:

CPU: Intel Core Ultra 9 275HX

Der hat eine 13Tops int8 NPU eingebaut, kann also auch schon die Modelle ein wenig beschleunigen. Ich weiß nicht, ob zwischen GPU und NPU verteilen kann, um die Modelle noch etwas schneller zu machen.

Εrnst B. schrieb:

Ryzen AI 9 365, 32GB Ram Gemma-4-e4b iGPU: 24.5 TPS (ca. 50 Watt) NPU: 11.8 TPS (ca. 10 Watt) CPU: 20.5 TPS (ca. 50 Watt)

CPU schneller als CPU? Wahrscheinlich könnte man mit llama.cpp Einfluss nehmen. In dem Video wird auf die Parameter wie "--n-gpu-layers" eingegangen, um die Verteilung der Rechenleistung etwas zu steuern.

https://www.youtube.com/watch?v=8F_5pdcD3HY

: Bearbeitet durch User
#8075626
Lesenswert?

Was benutzt ihr eigentlich fuer die Kommunikation mit der KI?

Ich hatte bisher aider benutzt. Soweit ganz nett, aber dann dachte ich mir hm..muesste doch auch irgendwie in Emacs gehen. Und jep, hat natuerlich schon jemand gemacht.

https://elpa.gnu.org/packages/ellama.html

Das ist cool! Hab mich gerade mit Qwen3-Coder:latest ueber ein Testprogramm unterhalten. Hat ein paar Sachen angemerkt und dann meine Software auf chinesisch kommentiert. Seufz! :-D

BTW: Qwen3-Coder:latest sind 18GB. Laeuft hier lokal in 48GB DDR4, meine olle Graka hat nur 8GB Vram. Ist lahm, aber fuer so kleine Sachen okay. Antwortzeiten so im einstelligen Sekundenbereich. Klar, haette lieber eine Radeon AI Pro R9700, aber 1500Kroets? Da warten wir mal ab bis sich die Hysterie am Markt etwas gelegt hat...

Vanye

#8075753
Lesenswert?

Vanye R. schrieb:

Was benutzt ihr eigentlich fuer die Kommunikation mit der KI?

Man kann llama.cpp mit ./llama-cli starten, dann kann man es mit dem Browser bedienen. Die Oberfläche sieht dann OpenWebUI sehr ähnlich, welches ich auch benutzte.

Vanye R. schrieb:

BTW: Qwen3-Coder:latest

Probiere quen3.6:35b mit der 4 bit Quantisierung von unsloth. Das läuft bei mir zusammen mit der 8GB RTX5060 und llama.cpp mit bis zu 30token/sec, was gar nicht mal so schlecht ist.

(Firma: Q3) #8075780
Lesenswert?

Vanye R. schrieb:

Was benutzt ihr eigentlich fuer die Kommunikation mit der KI?

Wir haben in der Firma eine Art KI-Server aufgebaut, um KI-Fähigkeiten in eigene Software-Projekte einzubauen, nur chatten ist langweilig. Die LLMs laufen unter Ollama, im Server-Mode auf Port 11434, HTTP mit POST.

Das nennt sich wohl REST-API, der Prompt (Frage/Aufgabe und Parameter) muss in JSON verpackt werden, die Antwort kommt ebenso ...

: Bearbeitet durch User
#8075898
Lesenswert?

Man kann llama.cpp mit ./llama-cli starten, dann kann man es mit dem Browser bedienen.

Ja gut, aber wie nutzt du das dann? Immer hin und her kopieren? Das scheint mir kein Zustand. Ich will jetzt nicht unbedingt Werbung fuer Emacs machen, aber schau dir mal an was Ellama fuer eine Funktionalitaet bietet.

Probiere quen3.6:35b mit der 4 bit Quantisierung von unsloth. Das läuft bei mir zusammen mit der 8GB RTX5060 und llama.cpp mit bis zu 30token/sec, was gar nicht mal so schlecht ist.

Hab ich natuerlich auch schon gemacht. Klar ist schneller. Denke gerade darueber nach 400Euro fuer eine RX9060 mit 16Gig rauszuhauen.

In dem Zusammenhang mal einen Tip. Ich habe aktuell eine 7-8Jahre alte RX550 mit 8GB Vram. Mein Rechner lief immer bombenstabil! Aber mit den KIs ist er gerne mal voll brutal mit merkwuerdig blinkenden Grafikbildschirm verreckt wenn die 10min gedacht haben. Sowas ist fuer Linux extrem untypisch. Hab dann die Graka ausgebaut, zerlegt, komplett gereinigt, mit Pressluft ausgeblasen, alle Kontakte an PCIe und am Stromstecker mit Kontakt 60 abgeschubbert, abgespuelt und wieder zusammengebaut. Jetzt laeuft die Kiste stabil! Wenn man nicht so ein Hartcorezocker ist dann laufen solche Karten normalerweise nur im Leerlauf und das fuehrt wohl dazu das die in ihren Ecken einiges an Staub einlagern.

BTW: Mir ist noch nicht ganz klar wie ollama die Rechnenlast verteilt. Obwohl ich auch fette KI Modelle habe die niemals in den Grafikspeicher passen, sehe ich mit dem amd-tool das die Grafikkarte bei diesen groesseren Modellen trotzdem zu 100% laeuft. Die wird also trotz Hauptspeicher immer irgendwie mitgenutzt.

Wir haben in der Firma eine Art KI-Server aufgebaut, um KI-Fähigkeiten in eigene Software-Projekte einzubauen, nur chatten ist langweilig. Die LLMs laufen unter Ollama, im Server-Mode auf Port 11434, HTTP mit POST.

Wenn ich alles richtig verstanden habe, bin da ja auch noch Einsteiger, ist das genau das was ich aktuell lokal bei mir auf dem Rechner laufen habe. Also auch Ollama. Darueber connecten sich dann die Clients wie Emacs/Ellama oder Aider. Bloss das es bei mir alles auf einem Rechner laeuft. Ja, in der Firma haette ich das auch gerne. Bloss mach das mal der IT Abteilung klar. :-D

Vanye

#8075900
Lesenswert?

Wir haben in der Firma eine Art KI-Server aufgebaut, um KI-Fähigkeiten in eigene Software-Projekte einzubauen,

Da stellt sich mir noch eine Frage. :-)

Ich selber bin ja nur eine Einzelperson und werde kaum mehr wie eine Anfrage laufen haben, aber in einer Firma koennte es ja sein das viele Leute dann so einen Server nutzen. Wie skaliert das dann? Braucht man dann eine noch fettere Grafikkarte? Oder muss der Server entsprechend Ram haben um, sagen wir mal 5-10 Leute gleichzeitig, bedienen zu koennen?

Vanye

(Firma: Q3) #8075916
Lesenswert?

Vanye R. schrieb:

Wir haben in der Firma eine Art KI-Server aufgebaut, um

KI-Fähigkeiten

in eigene Software-Projekte einzubauen,

Da stellt sich mir noch eine Frage. :-)

Ich selber bin ja nur eine Einzelperson und werde kaum mehr wie eine Anfrage laufen haben, aber in einer Firma koennte es ja sein das viele Leute dann so einen Server nutzen. Wie skaliert das dann?

Der größte Leistungszuwachs wird durch die Anzahl der GPUs und dem beigeordneten VRAM erzielt. Ich hab schon mal recherchieren lassen, ob ein LLM von mehreren Grafikkarten profitieren kann - dem ist wohl nicht so.

Also mögl. viel VRAM, am Besten 24...32GB und das wird (gegenwärtig) teuer

#8075929
Lesenswert?

beigeordneten VRAM erzielt. Ich hab schon mal recherchieren lassen, ob ein LLM von mehreren Grafikkarten profitieren kann - dem ist wohl nicht so.

Doch, es gibt bei Youtube ein Video wo sich jemand einen Rechner mit zwei 32GB Vram Karten von Ati aufgebaut hat. Der zeigt auch das er darin dann groessere Modelle laufen lassen kann wie 32GB, also die Karten werden dann schon beide fuer ein Modell genutzt. Er sagt aber auch das man bei kleinen Modellen darauf achten sollte nur eine Karte zu aktivieren weil sonst der Workload auch auf zwei Karten verteilt wird und das ist dann weniger schnell als wenn alles auf einer Karte laeuft.

Aber von den Kosten mal abgesehen, ich glaube nicht das man einen Rechner mit zwei solcher Karten haben moechte. Der heizt einen dann die Bude mit 1000W auf. Okay, bei einer Firma mag das angehen.

Vanye

#8077200
Lesenswert?

Ich bin durch Zufall auf einen interessaten Artikel gestossen auf den aufmerksam zu machen, ich mir hiermit erlaube. :)

https://tech-insider.org/de/rag-chatbot-selbst-bauen-lokal-2026/

Wenn wir programmieren dann ja nicht irgendwelchen Standardkram sondern "Embedded". Es scheint mir also Notwendig der KI ein paar Dinge bereitzustellen auf die sie sich beziehen kann. Also im Grund das Zeug das ihr alle gelesen habt und auswendig im Kopf habt. :-D

Datenblaetter und Applikationen passend zum verwendeten Controller

Beschreibung der verwendeten Hardware, externer Quarz ja/nein, Frequenz, wo ist was angeschlossen.

Ich hab das selbst noch nicht umgesetzt, wollte es aber in der naechsten Zeit machen.

Vanye

#8077229
Lesenswert?

Vanye R. schrieb:

https://tech-insider.org/de/rag-chatbot-selbst-bauen-lokal-2026/

Der Link ist gar nicht schlecht.

Es gibt mittlerweile noch eine andere Technik (anstatt RAG), die das eigene Wissen der lokalen KI verfügbar machen soll und ziemlich einfach aufgebaut ist: OKF (Open Knowledge Forma)
https://innfactory.ai/de/blog/open-knowledge-format-okf-standard-fuer-ki-wissen/
https://www.youtube.com/watch?v=MY9F9K7wWX4&t=780s

Ein anderes, ziemlich wichtiges Thema ist "skills.md" für die Agentensystem, in denen man die eigenen Abläufe beschreibt und mit denen man die System auf die eigenen Vorgehensweise optimieren kann:
https://www.mdskills.ai/de/specs/skill-md

: Bearbeitet durch User
#8077249
Lesenswert?

Vanye R. schrieb:

Ich bin durch Zufall auf einen interessaten Artikel gestossen auf den aufmerksam zu machen, ich mir hiermit erlaube. :)

https://tech-insider.org/de/rag-chatbot-selbst-bauen-lokal-2026/

Ich habe im letzten Jahr etwas mit RAG experimentiert. Die Ergebnisse waren enttäuschend. Das liegt in erster Linie an der Vektorsuche.

Bei ganz kleinen Datenbanken mit wenigen Dokumenten oder bei Datenbanken, die nur sehr unterschiedliche Dokumente enthalten, mag das noch gehen. Wenn man aber z.B. Datenblätter per KI durchsuchen will, ähneln sich die Inhalte dieser Dokumente sehr. Die reine Vektorsuche findet dann die Chunks, die am besten zur Frage passen. Der Chunk enthält aber keine Metadaten - d.h. die Vektorsuche berücksichtigt z.B. das Bauteil, das ja nicht überall im Text neu erwähnt wird, nicht. Man erhält also in vielen Fällen eine Antwort, die zwar zum Inhalt der Frage passt, sich aber nicht auf das gewünschte Bauteil bezieht.

In dem verlinkten Artikel steht ganz unten ein Absatz, der mit "Der nächste logische Ausbau" beginnt. Die Punkte, die darin erwähnt sind, scheinen für eine nutzbare Anwendung unerlässlich zu sein. Und die sind wesentlich aufwändiger als die Skripte für das einfache RAG.

#8077252
Lesenswert?

Christoph M. schrieb:

Es gibt mittlerweile noch eine andere Technik (anstatt RAG), die das eigene Wissen der lokalen KI verfügbar machen soll und ziemlich einfach aufgebaut ist: OKF (Open Knowledge Forma) https://innfactory.ai/de/blog/open-knowledge-format-okf-standard-fuer-ki-wissen/ https://www.youtube.com/watch?v=MY9F9K7wWX4&t=780s

In diesem Video wird das kurz vorgestellt: https://www.youtube.com/watch?v=RU8Ad_5rrnE

Darin werden auch die Schwächen des LLM Wikis durchleuchtet. Für eine Wissensdatenbank z.B. mit Datenblättern ist das m.E. derzeit nicht geeignet.

: Bearbeitet durch User
#8077279
Lesenswert?

Klaus P. schrieb:

Die reine Vektorsuche findet dann die Chunks, die am besten zur Frage passen. Der Chunk enthält aber keine Metadaten

Du kannst beim indizieren die Metadaten hinzufügen, als "title","summary", "metadata":{"chip":"NE555","type":"datasheet"}... Dann instruierst deine KI, dass bei Suche nach Datenblättern das "chip"-Feld möglichst mit in die Suchanfrage soll, oder bei den Antwort-Chunks kontrolliert werden soll, ob die Antwort auch zum richtigen Datenblatt gehört.

Ist halt keine schlüsselfertige Lösung, wo du einfach einfach einen Ordner an PDFs reinwerfen kannst. Aber jetzt auch nicht so der Riesen-Aufwand ein kleines LLM in den Import-Prozess zu hängen, was dir für jedes PDF einmalig die Metadaten im passenden Format extrahiert.

#8077286
Lesenswert?

Die Überschrift es Threads heist "Re: KI Modellgeschwindigkeit verschiedene Hardware". Es geht also um das Thema Token/Sec bezogen auf die Hardware.

Das Thema Rag, OKF usw. passt eher zum KI Codig/Agent Harness
Beitrag "KI Coding / Agent Harness"

Ich lege ein wenig Wert auf eine korrekte Einordnung, weil ich die Threads oft als Nachschlagewerk nutze und dann ist es unpraktisch, wenn zu viele Themen vermischt sind.

Klaus P. schrieb:

In diesem Video wird das kurz vorgestellt: https://www.youtube.com/watch?v=RU8Ad_5rrnE

Darin werden auch die Schwächen des LLM Wikis durchleuchtet. Für eine Wissensdatenbank z.B. mit Datenblättern ist das m.E. derzeit nicht geeignet.

#8077589
Lesenswert?

Klaus P. schrieb:

Ich habe im letzten Jahr etwas mit RAG experimentiert. Die Ergebnisse waren enttäuschend. Das liegt in erster Linie an der Vektorsuche.

Bei ganz kleinen Datenbanken mit wenigen Dokumenten oder bei Datenbanken, die nur sehr unterschiedliche Dokumente enthalten, mag das noch gehen. Wenn man aber z.B. Datenblätter per KI durchsuchen will, ähneln sich die Inhalte dieser Dokumente sehr. Die reine Vektorsuche findet dann die Chunks, die am besten zur Frage passen. Der Chunk enthält aber keine Metadaten - d.h. die Vektorsuche berücksichtigt z.B. das Bauteil, das ja nicht überall im Text neu erwähnt wird, nicht.

Vielleicht wäre im diesem Fall eine klassische Volltext-Suchmaschine wie OpenSearch besser geeignet. Die kann auch Vektorsuche, bei Bedarf auch kombiniert mit klassischen, bei Bedarf auch unscharfen Suchlgorithmen über indizierte Daten und Tfidf zur Gewichtung von Worten anhand ihrer Häufigkeiten. Bei Elastic- und OpenSearch lassen sich die PDFs auch gleich über ein Plugin mit Apache Tika (iirc) einlesen.

#8078274
Lesenswert?

Vielleicht wäre im diesem Fall eine klassische Volltext-Suchmaschine wie OpenSearch besser geeignet. Die kann auch Vektorsuche ...

Es geht ja bei Weitem nicht nur um Suche, sondern auch um Zusammenfassung und Interpretation ... seltsame Anmerkung.

Zusammenfassung und Interpretation ist Aufgabe des LLM. Dazu braucht es aber den richtigen Input, deshalb ist der Einwand mit OpenSearch/Elastic durchaus berechtigt. Shit In - Shit Out.

Antwort schreiben

Bitte melde dich an, um einen Beitrag zu schreiben.

oder

Mit Google-Account einloggen

Die Registrierung ist kostenlos und dauert nur eine Minute.

Jetzt registrieren