Dieses Tool findet das perfekte KI-Modell für Ihre Hardware (llmfit)
BBetter Stack
Computing/SoftwareConsumer ElectronicsInternet Technology
Transcript
00:00:00Eine kurze Frage. Wisst ihr, wie viele KI-Modelle es da draußen eigentlich gibt?
00:00:04Nun, laut Hugging Face gibt es über 3 Millionen öffentlich verfügbare Modelle.
00:00:10Und sagen wir mal, ihr habt ein Modell gefunden, das euch wirklich gefällt, geht auf dessen Hugging-Face-Seite,
00:00:15versucht es herunterzuladen, und es gibt gefühlt 9 verschiedene Quantisierungen, 4 verschiedene
00:00:21Parametergrößen und keinerlei Hinweis darauf, ob das überhaupt auf eurem speziellen Computer läuft.
00:00:26Idealerweise möchte man vorher wissen, ob dieses Modell einen Arbeitsspeicherfehler auslöst,
00:00:31bevor man die vollen 8 Gigabyte herunterlädt. Wie entscheidet man sich also für das richtige?
00:00:36Nun, glücklicherweise gibt es dafür mittlerweile ein Tool. Es heißt LLM Fit und schaut sich eure tatsächliche Hardware an,
00:00:43eure GPU, euren Arbeitsspeicher, eure CPU, und sagt euch dann aus Hunderten von Modellen, welche davon wirklich
00:00:49gut auf eurem Rechner laufen und wie hoch ihre Leistung sein wird. Und wie ihr hier sehen könnt, habe ich eine Reihe
00:00:55verschiedener Geräte auf dem Tisch. In diesem Video werden wir uns LLM Fit also ansehen, schauen, wie es
00:01:01funktioniert, und es dann auf einigen dieser Maschinen ausprobieren, um zu sehen, welche Modelle zu ihnen passen.
00:01:06Das wird eine Menge Spaß machen, also stürzen wir uns darauf.
00:01:13Im Kern ist LLM Fit ein einfaches Terminal-Tool. Man führt einen Befehl aus, und es erkennt
00:01:19euer System, eure CPU-Kerne, den Arbeitsspeicher und die GPU, einschließlich Multi-GPU-Setups. Danach bewertet es euer Setup
00:01:26anhand einer Reihe verfügbarer Modelle aus seiner Datenbank. Und nicht nur das, es gibt euch auch
00:01:32einen Anhaltspunkt darüber, wie viele Token pro Sekunde ihr auf eurem lokalen Setup bei der Ausführung dieses
00:01:37bestimmten Modells erwarten könnt. Um eure Hardware-Fähigkeiten richtig einzuschätzen, nutzt es natürlich die besten Tools
00:01:43für den Job, je nach euren GPU-Karten und eurer Infrastruktur. Außerdem wird bewertet, ob ihr
00:01:49ein Beschleunigungs-Backend auf eurem Rechner installiert habt. Zudem versucht es, den besten Quantisierungsgrad
00:01:55für dieses spezielle Modell basierend auf euren Hardware-Anforderungen zu ermitteln. Jedes Modell wird anhand
00:02:01von vier Kriterien bewertet: Qualität, Geschwindigkeit, Passgenauigkeit und Kontext. Diese werden dann zu einem Gesamtergebnis zusammengefasst.
00:02:08Aber die Art und Weise, wie sie gegeneinander gewichtet werden, ist nicht immer fest. Bei Chat-Anwendungen ist beispielsweise
00:02:14Geschwindigkeit wichtiger, während bei logischem Schließen die Qualität viel höher gewichtet wird. Dasselbe Modell kann also unterschiedlich abschneiden,
00:02:20je nachdem, was ihr eigentlich damit machen wollt. Aber wie ermittelt LLM Fit diese
00:02:25Geschwindigkeitswerte eigentlich? Nun, es funktioniert so, dass für jedes Token einmal die gesamten Modellgewichte
00:02:31aus dem VRAM gelesen werden müssen. Die Geschwindigkeit hängt also im Grunde davon ab, wie schnell euer VRAM die GPU füttern kann.
00:02:38LLM Fit ermittelt die reale Speicherbandbreite eurer spezifischen Karte, nimmt diesen Wert und gleicht ihn
00:02:44mit der Modellgröße ab, um zu schätzen, wie viele Token pro Sekunde ihr tatsächlich erhalten werdet. Wer sich
00:02:49im Detail damit befassen möchte, findet auch ein erweitertes Konfigurationsfenster, in dem ihr all das
00:02:54selbst anpassen könnt. Das wurde hinzugefügt, nachdem jemand auf GitHub darauf hingewiesen hatte, dass die Schätzungen
00:03:00für Token pro Sekunde für bestimmte Modelle zu hoch ausfielen. Wenn ihr eine andere GPU habt, die nicht in der Bandbreitentabelle
00:03:06steht, wird auf Backend-Konstanten zurückgegriffen – CUDA, Metal, ROCm und so weiter. Man steht also nie mit einer
00:03:14Null-Schätzung da, sondern erhält eventuell nur eine etwas weniger präzise. Eine weitere tolle Sache ist,
00:03:19dass sie eine Community-Bestenliste haben, auf der ihr die Leistungsergebnisse von realen Nutzern mit derselben
00:03:24Hardware wie eurer einsehen könnt. Man kann es also mit einem praktischen Benchmark vergleichen und nicht nur mit einem theoretischen.
00:03:31Gut, dieses Tool klingt großartig. Also möchte ich es an einer Reihe verschiedener Geräte testen, weil mich
00:03:36wirklich neugierig macht, welche Art von Modellen man eigentlich auf älteren Geräten ausführen kann. Wir fangen also mit
00:03:42diesem Raspberry Pi der ersten Generation an. Das Ding ist aus dem Jahr 2012, hat einen Single-Core, 700 Megahertz und 512 Megabyte
00:03:51Arbeitsspeicher. Vor ein paar Monaten habe ich ein Video gemacht, in dem ich erfolgreich ein Modell mit 19 Millionen Parametern
00:03:56darauf bereitgestellt habe. Mal sehen, ob LLM Fit in unserem Test etwas Ähnliches vorschlägt. Es sind hier tatsächlich
00:04:03ein paar Dinge passiert. Erstens lief es zwar, aber es war unglaublich langsam. Dieses Board hat einfach nicht
00:04:09die Rechenleistung, um eine Rust-KI bequem auszuführen. Aber schauen wir uns die Empfehlungen an, die
00:04:16einfach urkomisch sind. Als Erstes wird DeepSeek-R1 als beste Wahl mit fast 400
00:04:23Milliarden Parametern empfohlen. Das würde 230 Gigabyte Speicherplatz beanspruchen. Aber immerhin ist das Tool bei der
00:04:30Berechnung der Token pro Sekunde ehrlich und gibt nur 0,8 an. Der dafür benötigte Prozentsatz an Arbeitsspeicher
00:04:38ist ebenfalls völlig verrückt. Wie gesagt, ich hatte dieses Board ja bereits getestet und ein Modell namens Falcon H1 Mini darauf laufen lassen.
00:04:46Also habe ich versucht, nach genau diesem Modell zu suchen, um zu sehen, ob es in der Datenbank ist. Und es ist tatsächlich da,
00:04:51aber seltsamerweise erhält es im Vergleich zum enormen DeepSeek-R1 nur einen Wert von 51. Und das ist
00:04:58der lustigste Teil: Es heißt, damit seien 241 Token pro Sekunde möglich. Nun, in meinem Originalvideo
00:05:06lag es bei etwa 0,3 Token pro Sekunde. Das ist also etwa 800-mal so viel. Hier stimmt also offensichtlich
00:05:13etwas nicht. Und ich schätze, bei so alten Boards kann die App einfach keinen realistischen Kandidaten berechnen,
00:05:20was auch fair ist. Ich hätte nicht einmal gedacht, dass diese App überhaupt auf einem Raspberry Pi läuft, daher bin ich
00:05:26nicht allzu besorgt darüber. Als Nächstes widmen wir uns einem Luckfox Pico Ultra W. Das ist im normalen Sinne nicht einmal ein Computer,
00:05:34sondern ein winziges Embedded-Board für Kameramodule, Sicherheitssysteme und dergleichen.
00:05:40Aber es läuft Linux darauf und es hat einen Cortex-A7 Single-Core sowie 256 Megabyte Arbeitsspeicher. Da dieses
00:05:48Luckfox-Board mit einer speziellen vorinstallierten Linux-Version ausgeliefert wird, konnte ich mich einfach per SSH von
00:05:54meinem MacBook aus per SSH verbinden und LLM fit remote ausführen. Und hier sehen wir etwas Ähnliches wie beim Raspberry Pi.
00:06:01Es empfiehlt dasselbe DeepSeek-R1-Modell mit 400 Milliarden Parametern und vergibt dieselbe Punktzahl.
00:06:08Ich bin mir also nicht sicher. Ich habe das Gefühl, dass diese App einfach nicht dafür gedacht ist, Modellempfehlungen für so
00:06:14kleine Entwicklungsboards zu berechnen. Als Nächstes testen wir es auf einem 13-Zoll MacBook Pro von 2015 mit 8 GB DDR3-RAM
00:06:23und einem Intel Core i5. Das ist tatsächlich das erste Gerät auf der Liste, das ein echter Computer ist, mit dem Menschen produktiv arbeiten.
00:06:30Ich bin also gespannt, ob es überhaupt etwas Brauchbares findet oder ob das immer noch eine Sackgasse sein wird.
00:06:36Wie erwartet ist dies die erste Maschine, bei der die Liste der Empfehlungen tatsächlich
00:06:42recht brauchbar aussieht. Wir erhalten nun eine Liste voller kleiner Modelle, die alle als tauglich eingestuft werden.
00:06:48Das ist ein gutes Zeichen. Fast alle davon sind auf acht Bit quantisiert, mit geschätzten Werten von
00:06:5540 bis 170 Token pro Sekunde, je nach Modell. Aber um ehrlich zu sein, halte ich das für
00:07:02eine viel zu optimistische Schätzung. Ich glaube kaum, dass Llama 3 auf einem so alten MacBook von 2015 eine solche Token-Anzahl erreichen könnte.
00:07:09Aber wer weiß. Lasst es mich in den Kommentaren wissen, falls ihr ein Modell wie Llama 3 tatsächlich auf einem so alten MacBook getestet habt.
00:07:15Eine weitere coole Funktion dieses Tools ist die Möglichkeit, Anwendungsfälle zu filtern, um beispielsweise nach guten Programmiermodellen zu suchen.
00:07:20Wenn ich das einschränke, erhalten wir als beste Empfehlung Qwen 2.5 mit 12 Milliarden Parametern
00:07:27und einer 2-Bit-Quantisierung. (Hinweis: Im gesprochenen Text wird Qwen 3.6 genannt).
00:07:35Obwohl mich 2,3 Token pro Sekunde nicht wirklich glücklich machen, ist das wohl der Kompromiss, den man eingehen muss,
00:07:41wenn man 12 Milliarden Parameter auf einem so alten Laptop betreibt. Als Nächstes testen wir es auf meinem M2 Max
00:07:47MacBook Pro mit 32 Gigabyte gemeinsames Speichers (Unified Memory). Hier sollten die Dinge wieder viel
00:07:53normaler aussehen. Es hat echte GPU-Kerne und echte Speicherbandbreite, und LLM Fit versteht Apple
00:08:00Silicon ordnungsgemäß. Ich möchte also sehen, was hier empfohlen wird und wie nah die Geschwindigkeitsschätzung an das herankommt, was ich
00:08:06normalerweise erhalte. Auf meinem M2-MacBook ist die beste Empfehlung, wie wir sehen können, DeepSeek-R1.
00:08:13Obwohl ich nicht sicher bin, was für ein Modell das ist. Es heißt DeepSeek-R1, aber Qwen ist damit verknüpft.
00:08:18Ich bin mir also nicht sicher: Handelt es sich hierbei um eine Art symbiotisches Modell? Aber nach diesem Tool zu urteilen,
00:08:23ist dies wohl das Best-Case-Szenario für mein MacBook. Wenn wir jedoch erneut filtern
00:08:27und gezielt nach dem besten Programmiermodell suchen, sehen wir, dass die Version Gemma 2 9B (im Original Gemma 4 12B) an der Spitze steht.
00:08:34Und ich stimme dem tatsächlich zu, denn ich habe kürzlich ein Video zu diesem Modell gemacht und es war ein Biest,
00:08:39vor allem auf MLX-Setups. Ich stimme diesem Ergebnis also zu. Zu guter Letzt teste ich es auf meiner leistungsstärksten
00:08:45Maschine: der RTX 5090, 64 Gigabyte DDR5-RAM, Intel Core Ultra 9 285K. Das ist das System, bei dem ich
00:08:55tatsächlich erwarte, dass LLM Fit beginnt, die großen Modelle zu empfehlen. Schauen wir also, was meiner Meinung nach darauf läuft.
00:09:01Auf meiner starken Maschine erhalte ich eine Reihe von Empfehlungen für verschiedene Qwen-Versionen.
00:09:07Wie ihr dieses Mal sehen könnt, erhalte ich für fast alle davon eine perfekte Punktzahl. Es gibt also eine Fülle von
00:09:12Modellen zur Auswahl. Unter all den Qwen-Versionen taucht zudem die Gemma-Version auf.
00:09:18Aber auch hier möchte ich filtern, um zu sehen, welches die besten Programmiermodelle sind. Selbst mit diesem Filter
00:09:23erhalte ich nach wie vor eine Reihe von Qwen-Modellen. Wenn ich das Ganze jedoch nach Kontextgröße sortiere, sehen wir,
00:09:30dass es tatsächlich eine von Nvidia veröffentlichte Flash-Version gibt. Das ist wirklich interessant.
00:09:38Und das kommt dem tatsächlichen Modell näher, das ich für diese spezifische Aufgabe auswählen würde.
00:09:43Ich will nicht zu hart mit Qwen ins Gericht gehen, aber ich bin ehrlich gesagt kein riesiger Fan ihrer Modelle.
00:09:47Deshalb wäre eine Alternative basierend darauf wahrscheinlich die bessere Wahl.
00:09:53Da habt ihr es also, Leute. Das ist LLM Fit in a Nutshell. Ich denke, heutzutage, wo es so viele
00:09:58KI-Modelle zur Auswahl gibt, neigen wir dazu, in eine Analyse-Paralyse zu verfallen. Es ist also schön,
00:10:04dass es einige Tools da draußen gibt, die diese Aufgabe, das richtige KI-Modell auszuwählen, zumindest etwas
00:10:10Was haltet ihr also von diesem Tool? Habt ihr es ausprobiert? Werdet ihr es nutzen?
00:10:15Lasst es uns unten in den Kommentaren wissen. Und Leute, falls euch diese Art von technischen
00:10:20Analysen gefällt, lasst es mich wissen, indem ihr auf den Daumen-nach-oben-Button unter dem Video klickt. Und vergesst auch nicht,
00:10:25unserem Kanal zu abonnieren. Hier war Andrus von BetterStack, und wir sehen uns in den nächsten Videos.