Dieses Tool findet das perfekte KI-Modell für Ihre Hardware (llmfit)

BBetter Stack
Computing/SoftwareConsumer ElectronicsInternet Technology

Transcript

00:00:00Eine kurze Frage. Wisst ihr, wie viele KI-Modelle es da draußen eigentlich gibt?
00:00:04Nun, laut Hugging Face gibt es über 3 Millionen öffentlich verfügbare Modelle.
00:00:10Und sagen wir mal, ihr habt ein Modell gefunden, das euch wirklich gefällt, geht auf dessen Hugging-Face-Seite,
00:00:15versucht es herunterzuladen, und es gibt gefühlt 9 verschiedene Quantisierungen, 4 verschiedene
00:00:21Parametergrößen und keinerlei Hinweis darauf, ob das überhaupt auf eurem speziellen Computer läuft.
00:00:26Idealerweise möchte man vorher wissen, ob dieses Modell einen Arbeitsspeicherfehler auslöst,
00:00:31bevor man die vollen 8 Gigabyte herunterlädt. Wie entscheidet man sich also für das richtige?
00:00:36Nun, glücklicherweise gibt es dafür mittlerweile ein Tool. Es heißt LLM Fit und schaut sich eure tatsächliche Hardware an,
00:00:43eure GPU, euren Arbeitsspeicher, eure CPU, und sagt euch dann aus Hunderten von Modellen, welche davon wirklich
00:00:49gut auf eurem Rechner laufen und wie hoch ihre Leistung sein wird. Und wie ihr hier sehen könnt, habe ich eine Reihe
00:00:55verschiedener Geräte auf dem Tisch. In diesem Video werden wir uns LLM Fit also ansehen, schauen, wie es
00:01:01funktioniert, und es dann auf einigen dieser Maschinen ausprobieren, um zu sehen, welche Modelle zu ihnen passen.
00:01:06Das wird eine Menge Spaß machen, also stürzen wir uns darauf.
00:01:13Im Kern ist LLM Fit ein einfaches Terminal-Tool. Man führt einen Befehl aus, und es erkennt
00:01:19euer System, eure CPU-Kerne, den Arbeitsspeicher und die GPU, einschließlich Multi-GPU-Setups. Danach bewertet es euer Setup
00:01:26anhand einer Reihe verfügbarer Modelle aus seiner Datenbank. Und nicht nur das, es gibt euch auch
00:01:32einen Anhaltspunkt darüber, wie viele Token pro Sekunde ihr auf eurem lokalen Setup bei der Ausführung dieses
00:01:37bestimmten Modells erwarten könnt. Um eure Hardware-Fähigkeiten richtig einzuschätzen, nutzt es natürlich die besten Tools
00:01:43für den Job, je nach euren GPU-Karten und eurer Infrastruktur. Außerdem wird bewertet, ob ihr
00:01:49ein Beschleunigungs-Backend auf eurem Rechner installiert habt. Zudem versucht es, den besten Quantisierungsgrad
00:01:55für dieses spezielle Modell basierend auf euren Hardware-Anforderungen zu ermitteln. Jedes Modell wird anhand
00:02:01von vier Kriterien bewertet: Qualität, Geschwindigkeit, Passgenauigkeit und Kontext. Diese werden dann zu einem Gesamtergebnis zusammengefasst.
00:02:08Aber die Art und Weise, wie sie gegeneinander gewichtet werden, ist nicht immer fest. Bei Chat-Anwendungen ist beispielsweise
00:02:14Geschwindigkeit wichtiger, während bei logischem Schließen die Qualität viel höher gewichtet wird. Dasselbe Modell kann also unterschiedlich abschneiden,
00:02:20je nachdem, was ihr eigentlich damit machen wollt. Aber wie ermittelt LLM Fit diese
00:02:25Geschwindigkeitswerte eigentlich? Nun, es funktioniert so, dass für jedes Token einmal die gesamten Modellgewichte
00:02:31aus dem VRAM gelesen werden müssen. Die Geschwindigkeit hängt also im Grunde davon ab, wie schnell euer VRAM die GPU füttern kann.
00:02:38LLM Fit ermittelt die reale Speicherbandbreite eurer spezifischen Karte, nimmt diesen Wert und gleicht ihn
00:02:44mit der Modellgröße ab, um zu schätzen, wie viele Token pro Sekunde ihr tatsächlich erhalten werdet. Wer sich
00:02:49im Detail damit befassen möchte, findet auch ein erweitertes Konfigurationsfenster, in dem ihr all das
00:02:54selbst anpassen könnt. Das wurde hinzugefügt, nachdem jemand auf GitHub darauf hingewiesen hatte, dass die Schätzungen
00:03:00für Token pro Sekunde für bestimmte Modelle zu hoch ausfielen. Wenn ihr eine andere GPU habt, die nicht in der Bandbreitentabelle
00:03:06steht, wird auf Backend-Konstanten zurückgegriffen – CUDA, Metal, ROCm und so weiter. Man steht also nie mit einer
00:03:14Null-Schätzung da, sondern erhält eventuell nur eine etwas weniger präzise. Eine weitere tolle Sache ist,
00:03:19dass sie eine Community-Bestenliste haben, auf der ihr die Leistungsergebnisse von realen Nutzern mit derselben
00:03:24Hardware wie eurer einsehen könnt. Man kann es also mit einem praktischen Benchmark vergleichen und nicht nur mit einem theoretischen.
00:03:31Gut, dieses Tool klingt großartig. Also möchte ich es an einer Reihe verschiedener Geräte testen, weil mich
00:03:36wirklich neugierig macht, welche Art von Modellen man eigentlich auf älteren Geräten ausführen kann. Wir fangen also mit
00:03:42diesem Raspberry Pi der ersten Generation an. Das Ding ist aus dem Jahr 2012, hat einen Single-Core, 700 Megahertz und 512 Megabyte
00:03:51Arbeitsspeicher. Vor ein paar Monaten habe ich ein Video gemacht, in dem ich erfolgreich ein Modell mit 19 Millionen Parametern
00:03:56darauf bereitgestellt habe. Mal sehen, ob LLM Fit in unserem Test etwas Ähnliches vorschlägt. Es sind hier tatsächlich
00:04:03ein paar Dinge passiert. Erstens lief es zwar, aber es war unglaublich langsam. Dieses Board hat einfach nicht
00:04:09die Rechenleistung, um eine Rust-KI bequem auszuführen. Aber schauen wir uns die Empfehlungen an, die
00:04:16einfach urkomisch sind. Als Erstes wird DeepSeek-R1 als beste Wahl mit fast 400
00:04:23Milliarden Parametern empfohlen. Das würde 230 Gigabyte Speicherplatz beanspruchen. Aber immerhin ist das Tool bei der
00:04:30Berechnung der Token pro Sekunde ehrlich und gibt nur 0,8 an. Der dafür benötigte Prozentsatz an Arbeitsspeicher
00:04:38ist ebenfalls völlig verrückt. Wie gesagt, ich hatte dieses Board ja bereits getestet und ein Modell namens Falcon H1 Mini darauf laufen lassen.
00:04:46Also habe ich versucht, nach genau diesem Modell zu suchen, um zu sehen, ob es in der Datenbank ist. Und es ist tatsächlich da,
00:04:51aber seltsamerweise erhält es im Vergleich zum enormen DeepSeek-R1 nur einen Wert von 51. Und das ist
00:04:58der lustigste Teil: Es heißt, damit seien 241 Token pro Sekunde möglich. Nun, in meinem Originalvideo
00:05:06lag es bei etwa 0,3 Token pro Sekunde. Das ist also etwa 800-mal so viel. Hier stimmt also offensichtlich
00:05:13etwas nicht. Und ich schätze, bei so alten Boards kann die App einfach keinen realistischen Kandidaten berechnen,
00:05:20was auch fair ist. Ich hätte nicht einmal gedacht, dass diese App überhaupt auf einem Raspberry Pi läuft, daher bin ich
00:05:26nicht allzu besorgt darüber. Als Nächstes widmen wir uns einem Luckfox Pico Ultra W. Das ist im normalen Sinne nicht einmal ein Computer,
00:05:34sondern ein winziges Embedded-Board für Kameramodule, Sicherheitssysteme und dergleichen.
00:05:40Aber es läuft Linux darauf und es hat einen Cortex-A7 Single-Core sowie 256 Megabyte Arbeitsspeicher. Da dieses
00:05:48Luckfox-Board mit einer speziellen vorinstallierten Linux-Version ausgeliefert wird, konnte ich mich einfach per SSH von
00:05:54meinem MacBook aus per SSH verbinden und LLM fit remote ausführen. Und hier sehen wir etwas Ähnliches wie beim Raspberry Pi.
00:06:01Es empfiehlt dasselbe DeepSeek-R1-Modell mit 400 Milliarden Parametern und vergibt dieselbe Punktzahl.
00:06:08Ich bin mir also nicht sicher. Ich habe das Gefühl, dass diese App einfach nicht dafür gedacht ist, Modellempfehlungen für so
00:06:14kleine Entwicklungsboards zu berechnen. Als Nächstes testen wir es auf einem 13-Zoll MacBook Pro von 2015 mit 8 GB DDR3-RAM
00:06:23und einem Intel Core i5. Das ist tatsächlich das erste Gerät auf der Liste, das ein echter Computer ist, mit dem Menschen produktiv arbeiten.
00:06:30Ich bin also gespannt, ob es überhaupt etwas Brauchbares findet oder ob das immer noch eine Sackgasse sein wird.
00:06:36Wie erwartet ist dies die erste Maschine, bei der die Liste der Empfehlungen tatsächlich
00:06:42recht brauchbar aussieht. Wir erhalten nun eine Liste voller kleiner Modelle, die alle als tauglich eingestuft werden.
00:06:48Das ist ein gutes Zeichen. Fast alle davon sind auf acht Bit quantisiert, mit geschätzten Werten von
00:06:5540 bis 170 Token pro Sekunde, je nach Modell. Aber um ehrlich zu sein, halte ich das für
00:07:02eine viel zu optimistische Schätzung. Ich glaube kaum, dass Llama 3 auf einem so alten MacBook von 2015 eine solche Token-Anzahl erreichen könnte.
00:07:09Aber wer weiß. Lasst es mich in den Kommentaren wissen, falls ihr ein Modell wie Llama 3 tatsächlich auf einem so alten MacBook getestet habt.
00:07:15Eine weitere coole Funktion dieses Tools ist die Möglichkeit, Anwendungsfälle zu filtern, um beispielsweise nach guten Programmiermodellen zu suchen.
00:07:20Wenn ich das einschränke, erhalten wir als beste Empfehlung Qwen 2.5 mit 12 Milliarden Parametern
00:07:27und einer 2-Bit-Quantisierung. (Hinweis: Im gesprochenen Text wird Qwen 3.6 genannt).
00:07:35Obwohl mich 2,3 Token pro Sekunde nicht wirklich glücklich machen, ist das wohl der Kompromiss, den man eingehen muss,
00:07:41wenn man 12 Milliarden Parameter auf einem so alten Laptop betreibt. Als Nächstes testen wir es auf meinem M2 Max
00:07:47MacBook Pro mit 32 Gigabyte gemeinsames Speichers (Unified Memory). Hier sollten die Dinge wieder viel
00:07:53normaler aussehen. Es hat echte GPU-Kerne und echte Speicherbandbreite, und LLM Fit versteht Apple
00:08:00Silicon ordnungsgemäß. Ich möchte also sehen, was hier empfohlen wird und wie nah die Geschwindigkeitsschätzung an das herankommt, was ich
00:08:06normalerweise erhalte. Auf meinem M2-MacBook ist die beste Empfehlung, wie wir sehen können, DeepSeek-R1.
00:08:13Obwohl ich nicht sicher bin, was für ein Modell das ist. Es heißt DeepSeek-R1, aber Qwen ist damit verknüpft.
00:08:18Ich bin mir also nicht sicher: Handelt es sich hierbei um eine Art symbiotisches Modell? Aber nach diesem Tool zu urteilen,
00:08:23ist dies wohl das Best-Case-Szenario für mein MacBook. Wenn wir jedoch erneut filtern
00:08:27und gezielt nach dem besten Programmiermodell suchen, sehen wir, dass die Version Gemma 2 9B (im Original Gemma 4 12B) an der Spitze steht.
00:08:34Und ich stimme dem tatsächlich zu, denn ich habe kürzlich ein Video zu diesem Modell gemacht und es war ein Biest,
00:08:39vor allem auf MLX-Setups. Ich stimme diesem Ergebnis also zu. Zu guter Letzt teste ich es auf meiner leistungsstärksten
00:08:45Maschine: der RTX 5090, 64 Gigabyte DDR5-RAM, Intel Core Ultra 9 285K. Das ist das System, bei dem ich
00:08:55tatsächlich erwarte, dass LLM Fit beginnt, die großen Modelle zu empfehlen. Schauen wir also, was meiner Meinung nach darauf läuft.
00:09:01Auf meiner starken Maschine erhalte ich eine Reihe von Empfehlungen für verschiedene Qwen-Versionen.
00:09:07Wie ihr dieses Mal sehen könnt, erhalte ich für fast alle davon eine perfekte Punktzahl. Es gibt also eine Fülle von
00:09:12Modellen zur Auswahl. Unter all den Qwen-Versionen taucht zudem die Gemma-Version auf.
00:09:18Aber auch hier möchte ich filtern, um zu sehen, welches die besten Programmiermodelle sind. Selbst mit diesem Filter
00:09:23erhalte ich nach wie vor eine Reihe von Qwen-Modellen. Wenn ich das Ganze jedoch nach Kontextgröße sortiere, sehen wir,
00:09:30dass es tatsächlich eine von Nvidia veröffentlichte Flash-Version gibt. Das ist wirklich interessant.
00:09:38Und das kommt dem tatsächlichen Modell näher, das ich für diese spezifische Aufgabe auswählen würde.
00:09:43Ich will nicht zu hart mit Qwen ins Gericht gehen, aber ich bin ehrlich gesagt kein riesiger Fan ihrer Modelle.
00:09:47Deshalb wäre eine Alternative basierend darauf wahrscheinlich die bessere Wahl.
00:09:53Da habt ihr es also, Leute. Das ist LLM Fit in a Nutshell. Ich denke, heutzutage, wo es so viele
00:09:58KI-Modelle zur Auswahl gibt, neigen wir dazu, in eine Analyse-Paralyse zu verfallen. Es ist also schön,
00:10:04dass es einige Tools da draußen gibt, die diese Aufgabe, das richtige KI-Modell auszuwählen, zumindest etwas
00:10:10Was haltet ihr also von diesem Tool? Habt ihr es ausprobiert? Werdet ihr es nutzen?
00:10:15Lasst es uns unten in den Kommentaren wissen. Und Leute, falls euch diese Art von technischen
00:10:20Analysen gefällt, lasst es mich wissen, indem ihr auf den Daumen-nach-oben-Button unter dem Video klickt. Und vergesst auch nicht,
00:10:25unserem Kanal zu abonnieren. Hier war Andrus von BetterStack, und wir sehen uns in den nächsten Videos.

Key Takeaway

Das Terminal-Tool LLM Fit analysiert lokale Hardwareressourcen wie GPU und Arbeitsspeicher, um passende KI-Modelle sowie erwartete Token-Geschwindigkeiten aus einer Datenbank zu ermitteln.

Highlights

  • Hugging Face beherbergt über 3 Millionen öffentlich verfügbare KI-Modelle.

  • LLM Fit ist ein Terminal-Tool zur Hardware-Erkennung und Modell-Leistungsbewertung.

  • Das Tool bewertet Modelle anhand von Qualität, Geschwindigkeit, Passgenauigkeit und Kontext.

  • Auf einem Raspberry Pi der ersten Generation empfiehlt das Tool unrealistischerweise DeepSeek-R1 mit fast 400 Milliarden Parametern.

  • Ein M2 Max MacBook Pro mit 32 Gigabyte Unified Memory verarbeitet lokal passende Modelle wie Gemma 2 9B präzise.

Timeline

Problemstellung und Einführung in LLM Fit

  • Millionen verfügbare KI-Modelle erschweren die Auswahl für die eigene Hardware.
  • Mangelnde Hardware-Informationen führen oft zu unerwarteten Arbeitsspeicherfehlern.
  • LLM Fit untersucht die vorhandene Hardware und ermittelt kompatible Modelle samt Leistungsprognose.

Hugging Face bietet Millionen von Modellen an, deren Quantisierungen und Parametergrößen selten klar auf die eigene Hardware abgestimmt sind. Das Tool LLM Fit analysiert GPU, CPU und Arbeitsspeicher, um Modelle vor dem Download auf ihre Machbarkeit und Leistung zu überprüfen.

Funktionsweise und Berechnungslogik des Tools

  • Das Terminal-Tool erkennt CPU-Kerne, Arbeitsspeicher und Multi-GPU-Setups.
  • Die Token-Geschwindigkeit basiert auf der realen Speicherbandbreite des VRAM.
  • Modelle werden nach Qualität, Geschwindigkeit, Passgenauigkeit und Kontext bewertet.

LLM Fit liest die Systemdaten über ein einfaches Terminal-Kommando aus. Da für jedes Token die Modellgewichte aus dem VRAM geladen werden müssen, berechnet das Tool anhand der Speicherbandbreite die zu erwartenden Token pro Sekunde. Die Gewichtung der vier Bewertungskriterien passt sich je nach Anwendungsfall an.

Praxistests auf älteren und eingebetteten Geräten

  • Ein Raspberry Pi aus dem Jahr 2012 liefert durch extreme Hardware-Limitierungen unrealistische Empfehlungen.
  • Das Embedded-Board Luckfox Pico Ultra W erzeugt ebenfalls unbrauchbare Vorschläge für gigantische Modelle.
  • Alte Einplatinencomputer besitzen nicht die Rechenleistung für komplexe KI-Berechnungen.

Tests auf einem Raspberry Pi der ersten Generation und einem Luckfox-Embedded-Board zeigen die Grenzen des Tools bei extrem schwacher Hardware. Das Tool schlägt dort standardmäßig Modelle wie DeepSeek-R1 mit 400 Milliarden Parametern vor, obwohl die tatsächliche Leistung dafür bei unter einem Token pro Sekunde liegt.

Auswertung auf echten Computern und Apple Silicon

  • Ein MacBook Pro von 2015 erhält erstmals brauchbare Empfehlungen kleiner quantisierter Modelle.
  • Ein M2 Max MacBook Pro mit 32 Gigabyte Unified Memory verarbeitet Apple Silicon korrekt.
  • Die RTX 5090 liefert auf einer leistungsstarken Desktop-Konfiguration passende Vorschläge für Qwen- und Gemma-Varianten.

Auf einem echten Intel-MacBook von 2015 schlägt das Tool kleine, stark quantisierte Modelle vor. Leistungsfähigere Systeme wie das M2 Max MacBook Pro und eine RTX 5090-Workstation ermöglichen deutlich realistischere und performantere Modellvorschläge, insbesondere beim Filtern nach spezifischen Anwendungsfällen wie Programmierung.

Fazit zur Modellauswahl

  • LLM Fit reduziert die Überforderung bei der Suche nach passenden lokalen KI-Modellen.
  • Das Tool bietet praktische Hilfestellungen gegen Analyse-Paralyse.

Angesichts von Millionen verfügbarer KI-Modelle unterstützt LLM Fit Anwender dabei, die passende Software für ihre spezifische Hardware-Infrastruktur zu finden, und verhindert so unnötige Downloads.

Community Posts

View all posts