Dieser Server-Monitor ist beeindruckend. Das solltest du wirklich vermarkten und verkaufen! ![]()
Oder ihn zumindest veröffentlichen…
Dieser Server-Monitor ist beeindruckend. Das solltest du wirklich vermarkten und verkaufen! ![]()
Oder ihn zumindest veröffentlichen…
Na9d,
Danke für das Kompliment, aber es ist schwierig, das Ganze als eigenständige Lösung anzubieten – dafür gibt es mehrere Gründe.
Erstens existiert vieles davon nur, um typische Strukturprobleme von QNAP zu umgehen. Das mitgelieferte busybox im QNAP-Betriebssystem ist uralt und lässt sich weder anpassen noch aktualisieren. Also musste ich einen Container mit meiner eigenen, modernen Toolchain aufsetzen und alles darauf aufbauen, anstatt die Standard-Tools zu nutzen.
Da QNAP jedoch geradezu obsessiv die Standardkonfiguration schützt, überlebt nichts, das du in einer laufenden Shell einrichtest, einen Neustart oder ein Firmware-Update. Gestartete Daemons, alles ist nur für die aktuelle Session. Ein autorun.sh-Skript muss also die gesamte Umgebung beim Start neu aufbauen: Daemons wieder starten, die Toolbox einbinden und die Cron-Jobs neu anlegen – und das alles, weil QNAP auch die laufende crontab bei jedem Neustart überschreibt, einschließlich Crash-Neustarts. Dauerhafte Einträge müssen also in der richtigen Konfigurationsdatei stehen und vom Startskript wiederhergestellt werden. Und nach jedem Firmware-Update muss sogar der autorun-Hook selbst erneut überprüft werden, da Updates diesen zurücksetzen können.
Eine eigenständige Version würde bedeuten, dass die Nutzer autorun und cron auf ihren eigenen Geräten ändern müssten. Beides bietet jede Menge Möglichkeiten für potenziell zerstörerische Fehler, falls man sich vertippt. Es gibt vieles, das ich an QNAP mag, aber die Einschränkungen, mit denen Nutzer vor katastrophalen Konfigurationsänderungen geschützt werden sollen, machen die Workarounds zwangsläufig ziemlich invasiv.
Könnte ich das Ganze paketieren? Wahrscheinlich. Aber dann bin ich derjenige, den man beim ersten Datenverlust oder kaputten NAS verantwortlich macht.
Ich wollte nur kurz erwähnen, dass ich Rel 6 sowohl auf meinem TS-h1290FX als auch auf meinem TS-j1277AFX installiert habe und die Installation bei beiden problemlos verlief. Allerdings hat der Neustart des 1277 nach der Installation ziemlich lange gedauert, aber jetzt ist alles in Ordnung. Das Upgrade hatte ich über eine Woche hinausgezögert.
Ich glaube nicht, dass es sich um eine Beta handelt, denn es gibt weder Beta-Tags noch einen RC (Release Candidate)-Tag. Für mich sieht das nach einem vollständigen Produktionsrelease von QuTS hero 6 aus.
Ha! Guter Hinweis. Ich bin so daran gewöhnt, dass die h6.x-Reihe im Beta ist, dass ich gar nicht gemerkt habe, dass 3550 tatsächlich ein offizielles Release war.
Manche würden vielleicht sogar behaupten, dass es tatsächlich noch eine Beta-Version ist und das entsprechende Label bei der Veröffentlichung einfach vergessen wurde. ![]()
Letztlich muss man irgendwann einfach anfangen und live gehen, sonst bleibt das Projekt für immer im Beta- oder RC-Status.
Hallo,
Am Wochenende habe ich mein NAS komplett zurückgesetzt und die neueste Firmware verwendet: h6.0.3564 Build 20260723.
Während der Installation vor dem Reset wurden die neuen nvkernerdriver-Treiber automatisch installiert.
Nach dem Reset war es unmöglich, ein Modell auf Ollama neu zu starten; am Ende funktionierte es erst nach einem Neustart (nach der Installation der Nvidia-Treiber). Trotzdem war es heute Morgen erneut unmöglich, ein Modell auf der GPU zu starten.
Wie am Wochenende gab es diese Fehlermeldungen in „dmesg“:
[59082.857111] NVRM: nvCheckOkFailedNoLog: Check failed: Out of memory [NV_ERR_NO_MEMORY] (0x00000051) returned from _memdescAllocInternal(pMemDesc) @ mem_desc.c:1353
[59082.871729] NVRM: faultbufCtrlCmdMmuFaultBufferRegisterNonReplayBuf_IMPL: Error allocating client shadow fault buffer for non-replayable faults
[59083.013898] NVRM: nvCheckOkFailedNoLog: Check failed: Out of memory [NV_ERR_NO_MEMORY] (0x00000051) returned from _memdescAllocInternal(pMemDesc) @ mem_desc.c:1353
[59083.028519] NVRM: faultbufCtrlCmdMmuFaultBufferRegisterNonReplayBuf_IMPL: Error allocating client shadow fault buffer for non-replayable faults
[59083.568050] NVRM: nvCheckOkFailedNoLog: Check failed: Out of memory [NV_ERR_NO_MEMORY] (0x00000051) returned from _memdescAllocInternal(pMemDesc) @ mem_desc.c:1353
[59083.582684] NVRM: faultbufCtrlCmdMmuFaultBufferRegisterNonReplayBuf_IMPL: Error allocating client shadow fault buffer for non-replayable faults
[59083.638931] NVRM: nvCheckOkFailedNoLog: Check failed: Out of memory [NV_ERR_NO_MEMORY] (0x00000051) returned from _memdescAllocInternal(pMemDesc) @ mem_desc.c:1353
[59083.653570] NVRM: faultbufCtrlCmdMmuFaultBufferRegisterNonReplayBuf_IMPL: Error allocating client shadow fault buffer for non-replayable faults
[59084.839297] NVRM: nvCheckOkFailedNoLog: Check failed: Out of memory [NV_ERR_NO_MEMORY] (0x00000051) returned from _memdescAllocInternal(pMemDesc) @ mem_desc.c:1353
[59084.853921] NVRM: faultbufCtrlCmdMmuFaultBufferRegisterNonReplayBuf_IMPL: Error allocating client shadow fault buffer for non-replayable faults
Ein Neustart des Ollama-Containers hat nicht ausgereicht, um eine funktionierende Karte zu erhalten. Ich musste das NAS neu starten.
Seit dem Reset konnte ich endlich eine VM fehlerfrei und ohne Probleme im virtuellen Switch installieren.
Das führt jedoch unvermeidlich zu Zeitverlust, und die Backups müssen korrekt verwaltet werden.
Während meiner Recherche am Wochenende, um die Grafikkarte zum Laufen zu bringen, bin ich auf diesen Beitrag gestoßen; ich habe nur wenig Lust, dessen Empfehlungen zu folgen: Getting GPU-Accelerated PaddlePaddle Working in Docker on QNAP NAS
Außer QNAP verbessert die Situation
@achimede333 — diese dmesg-Ausgabe zeigt dein Problem deutlich. Es liegt nicht an den Treibern, nicht an Ollama und auch nicht an deinem VRAM. Hör auf, diesen Ursachen hinterherzulaufen.
Bevor du weiterliest
Ich bin selbst QNAP-Nutzer, kein QNAP-Mitarbeiter und habe keinerlei Verbindung zum QNAP-Support. Alles im Folgenden basiert auf meiner eigenen Erfahrung mit ähnlicher Hardware und wird ohne jegliche Gewährleistung bereitgestellt.
Du bist für dein NAS selbst verantwortlich. Lies und verstehe jeden Befehl, bevor du ihn ausführst, und stelle sicher, dass du vorher ein aktuelles und verifiziertes Backup von allem wichtigen hast.
Um klarzustellen, was ein Risiko birgt:
- Die Diagnose-Befehle (
df,free,du,dmesg,uptime) sind read-only und verändern nichts.- Das Remount und die Autorun-Bearbeitung sind Systemänderungen. Ein falsch getippter
mount-Befehl oder ein fehlerhaftes Startscript können ein NAS in einen Zustand bringen, aus dem es wiederhergestellt werden muss.Ich übernehme keinerlei Verantwortung oder Haftung für Schäden an deiner Hardware, deinen Daten oder deiner Konfiguration, die durch das Befolgen dieser Hinweise entstehen. Wenn dir das nicht zusagt, eröffne lieber ein Ticket beim QNAP-Support — und angesichts der Log-Ausgaben ist das vermutlich ohnehin der bessere Weg.
faultbufCtrlCmdMmuFaultBufferRegisterNonReplayBuf_IMPL: Error allocating client shadow fault buffer
nvCheckOkFailedNoLog: Out of memory [NV_ERR_NO_MEMORY]
Der NVIDIA-Kernel-Treiber versucht, den „client shadow fault buffer“ für MMU non-replayable faults zu reservieren. Dieser Buffer liegt im System-RAM, nicht im VRAM. Das Registrieren ist Teil der Einrichtung eines CUDA/UVM-Kontexts. Wenn diese Reservierung scheitert, kann kein CUDA-Kontext erstellt werden – deshalb findet Ollama beim Start und GPU-Suche nichts Nutzbares und fällt auf die CPU zurück.
Das erklärt alles, was du beobachtet hast:
nvidia-smi funktioniert weiterhin, weil das Management-Library nutzt und keinen CUDA-Kontext benötigt. Das ist das irreführendste Symptom auf QNAP.Deine dmesg-Ausgaben erscheinen bei 59082 Sekunden — 16 Stunden und 24 Minuten Laufzeit. In Kombination mit deinem Hinweis, dass ein Ollama-Container-Neustart nicht reicht, sondern das NAS neu gebootet werden muss, ist das Muster klar: Frisch gebootet funktioniert es, nach Stunden Laufzeit bricht es zusammen, und nur ein Neustart hilft.
Das ist ein sich über die Zeit erschöpfender Speicher. Kein Konfigurationsfehler verhält sich so; deshalb hat dein kompletter System-Reset das Problem nicht behoben und hätte es nie tun können.
Diese Befehle sind read-only. Führe sie jetzt aus, während das Problem besteht:
df -h /
free -h
Und nach dem nächsten Neustart wiederholen und die Ausgabe vergleichen. Wenn root im gestörten Zustand deutlich größer ist als nach dem Reboot, hast du die Ursache und kannst aufhören zu rätseln.
Ich verstehe dein Zögern beim PaddlePaddle-Post — das meiste davon ist ein Container-Build und betrifft dich nicht. Du brauchst weder das Dockerfile noch die pip pins oder Ähnliches. Es geht um folgenden einzigen Befehl:
mount -o remount,size=800M /
Das Root-Dateisystem von QNAP ist ein Ramdisk mit einem kleinen Standard-Limit. Diese Änderung gibt dem GPU-Treiber genug Spielraum, seinen Fault Buffer anzulegen.
Teste diesen Befehl im gestörten Zustand – wenn dann ein Modell auf die GPU geladen werden kann, ohne Neustart, sind Diagnose und Lösung auf einen Schlag bestätigt. Falls es nichts bringt, hast du zumindest eine Erkenntnis gewonnen und nichts verloren, da das Setting beim nächsten Reboot ohnehin zurückgesetzt wird.
Das Remount ist nicht persistent. mjellybaby pflegt es ins NvKernelDriver-QPKG-Startscript ein, was zwar funktioniert, aber dieses Script wird jedes Mal ersetzt, wenn du das Treiber-QPKG aktualisierst – und das hast du ja schon mehrfach getan.
Ich würde es stattdessen in autorun.sh ablegen. Das übersteht QPKG-Updates und muss nur nach Firmware-Updates überprüft werden, ist also deutlich weniger fehleranfällig als eine stille Regression nach jedem Treiber-Update.
Aber Achtung: Das Aktivieren und Bearbeiten von autorun ist eine Änderung, die du verstehen solltest, bevor du sie durchführst – ein fehlerhaftes autorun-Script wird bei jedem Boot ausgeführt.
Es ist sinnvoll, das herauszufinden, denn das Erhöhen des Limits behandelt das Symptom, nicht die Ursache.
Hinweis: Der Build, den du verwendest, h6.0.1.3564, beinhaltet laut Release Notes: „Fixed an issue where improper API handling would cause abnormal log writing and lead to ramdisk errors.“ QNAP weiß also bereits, dass Ramdisk-Überlauf auf dieser Firmware-Linie ein echtes Problem ist. Entweder ist diese Korrektur unvollständig, oder etwas anderes verbraucht sie bei dir.
Um das rauszufinden, im gestörten Zustand (read-only):
du -xk -d1 / 2>/dev/null | sort -n | tail -20
Das -x sorgt dafür, dass nur das Root-FS betrachtet wird und nicht deine Storage-Pools.
Eine Bitte: Egal wie es ausgeht, poste dein df -h / von vorher und nachher. Wenn ein Ramdisk, der sich über die Laufzeit füllt, GPU-Ausfälle auf h6.0.1 verursacht, ist das für QNAP in diesem Thread relevant.
Vielen Dank für deine großartige Antwort.
Zugegeben, vielleicht suche ich nicht an der richtigen Stelle nach der Lösung.
Ich habe die Befehle gerade getestet:
Verwendest du Busybox oder eine Installation von Tools, zum Beispiel über Entware?
Hast du die gleiche Konfiguration wie ich? Hast du nicht das gleiche Problem?
Ich habe deinen Rat und die Tipps aus dem Thread von Paddle gerne befolgt ;).
Eigentlich wollte ich damit sagen, dass diese Diskussion spannend ist und eine auf QNAP spezifische Struktur hervorhebt, die nicht „offensichtlich“ ist.
Viele Grüße
achimede333,
Sorry, Kumpel, das geht auf meine Kappe. Bei jedem Boot-Zyklus lade ich einen kompletten Werkzeugkasten in einen Container und setze ihn auf den Pfad, daher vergesse ich, dass nicht jeder dieselben Tools zur Verfügung hat. Die Befehle, die ich dir gegeben habe, setzen eine moderne busybox voraus. Deine ist aber die Standard-QNAP-Version, die deutlich älter ist.
free ohne Flags funktioniert auf jeder busybox (Ausgabe in KB). Falls selbst das Probleme macht, ist head -3 /proc/meminfo absolut zuverlässig — das liest direkt vom Kernel und kann keine falschen Optionen bekommen.du -xks /* gibt dir eine Ebene tief ganz ohne -d.Damit solltest du die gleichen Infos von der Standard-QNAP-busybox bekommen: „möge ihr uraltes, verstümmeltes Hinterteil in der Hölle brennen.“ Das ist einer meiner Dauerärgernisse mit QNAP und deren Griff nach der OS-Umgebung. Die gelieferte busybox kann nicht aktualisiert oder ersetzt werden, also musst du entweder drum herum arbeiten oder, wie ich, deine eigenen Tools im Container mitbringen.
dmesg | grep -i NVRM
df -k /
uptime
head -3 /proc/meminfo
Beachte, dass ich df -k statt df -h verwendet habe – aus dem gleichen Grund, dass free -h auf deiner Box gescheitert ist. -k ist sowieso der Standard auf busybox und funktioniert immer, egal welche Version. Die Größen kommen in KB zurück.
Ich bin mein eigenes System gewohnt, das 192 GB eingebaut hat. Wenn deins deutlich weniger hat, möchte ich ausschließen, dass die root-Ramdisk proportional zum verfügbaren Speicher und nicht mit einer festen Obergrenze angelegt wird.
Wenn das zutrifft, würde vieles erklären: Dieselbe Firmware und dieselbe GPU-Familie könnten auf zwei Maschinen völlig unterschiedlich reagieren, einfach weil eine mehr Luft hat, bevor der NVIDIA-Treiber keinen Platz mehr für den Fault Buffer bekommt. Das würde das Ganze zu einem Speichergrößen-Problem machen und nicht zu einem Konfigurationsproblem — genau die Art Sache, die unsichtbar bleibt, bis jemand mit einem kleineren Gerät darauf stößt.
Die Ausgaben von df -k / und /proc/meminfo zeigen uns, was Sache ist.
Thank you for your help!
The defect was present before the model loading. Here is the result before and after the model loading, in the… CPU ![]()
Before the load :
]$ dmesg | grep -i NVRM
[ 284.005891] NVRM: loading NVIDIA UNIX Open Kernel Module for x86_64 575.64.05 Release Build (dvs-builder@U22-A23-13-1) Fri Jul 18 16:00:10 UTC 2025
[27877.210663] NVRM: nvCheckOkFailedNoLog: Check failed: Out of memory [NV_ERR_NO_MEMORY] (0x00000051) returned from _memdescAllocInternal(pMemDesc) @ mem_desc.c:1353
[27877.225294] NVRM: faultbufCtrlCmdMmuFaultBufferRegisterNonReplayBuf_IMPL: Error allocating client shadow fault buffer for non-replayable faults
[27877.601371] NVRM: nvCheckOkFailedNoLog: Check failed: Out of memory [NV_ERR_NO_MEMORY] (0x00000051) returned from _memdescAllocInternal(pMemDesc) @ mem_desc.c:1353
[27877.616030] NVRM: sysmemConstruct_IMPL: *** Cannot allocate sysmem through fb heap
[27877.623639] NVRM: nvAssertOkFailedNoLog: Assertion failed: Out of memory [NV_ERR_NO_MEMORY] (0x00000051) returned from pRmApi->Alloc(pRmApi, device->session->handle, isSystemMemory ? device->handle : device->subhandle, &physHandle, isSystemMemory ? NV01_MEMORY_SYSTEM : NV01_MEMORY_LOCAL_USER, &memAllocParams, sizeof(memAllocParams)) @ nv_gpu_ops.c:4647
[27878.531209] NVRM: nvCheckOkFailedNoLog: Check failed: Out of memory [NV_ERR_NO_MEMORY] (0x00000051) returned from _memdescAllocInternal(pMemDesc) @ mem_desc.c:1353
[27878.545826] NVRM: faultbufCtrlCmdMmuFaultBufferRegisterNonReplayBuf_IMPL: Error allocating client shadow fault buffer for non-replayable faults
[27878.601580] NVRM: nvCheckOkFailedNoLog: Check failed: Out of memory [NV_ERR_NO_MEMORY] (0x00000051) returned from _memdescAllocInternal(pMemDesc) @ mem_desc.c:1353
[27878.616207] NVRM: faultbufCtrlCmdMmuFaultBufferRegisterNonReplayBuf_IMPL: Error allocating client shadow fault buffer for non-replayable faults
[27880.102423] NVRM: nvCheckOkFailedNoLog: Check failed: Out of memory [NV_ERR_NO_MEMORY] (0x00000051) returned from _memdescAllocInternal(pMemDesc) @ mem_desc.c:1353
[27880.117054] NVRM: faultbufCtrlCmdMmuFaultBufferRegisterNonReplayBuf_IMPL: Error allocating client shadow fault buffer for non-replayable faults
[27900.022239] NVRM: nvCheckOkFailedNoLog: Check failed: Out of memory [NV_ERR_NO_MEMORY] (0x00000051) returned from _memdescAllocInternal(pMemDesc) @ mem_desc.c:1353
[27900.036867] NVRM: faultbufCtrlCmdMmuFaultBufferRegisterNonReplayBuf_IMPL: Error allocating client shadow fault buffer for non-replayable faults
[28156.315466] NVRM: nvCheckOkFailedNoLog: Check failed: Out of memory [NV_ERR_NO_MEMORY] (0x00000051) returned from _memdescAllocInternal(pMemDesc) @ mem_desc.c:1353
[28156.330119] NVRM: faultbufCtrlCmdMmuFaultBufferRegisterNonReplayBuf_IMPL: Error allocating client shadow fault buffer for non-replayable faults
[28156.551884] NVRM: nvCheckOkFailedNoLog: Check failed: Out of memory [NV_ERR_NO_MEMORY] (0x00000051) returned from _memdescAllocInternal(pMemDesc) @ mem_desc.c:1353
[28156.566518] NVRM: faultbufCtrlCmdMmuFaultBufferRegisterNonReplayBuf_IMPL: Error allocating client shadow fault buffer for non-replayable faults
[28157.186096] NVRM: nvCheckOkFailedNoLog: Check failed: Out of memory [NV_ERR_NO_MEMORY] (0x00000051) returned from _memdescAllocInternal(pMemDesc) @ mem_desc.c:1353
[28157.200726] NVRM: faultbufCtrlCmdMmuFaultBufferRegisterNonReplayBuf_IMPL: Error allocating client shadow fault buffer for non-replayable faults
[28157.258996] NVRM: nvCheckOkFailedNoLog: Check failed: Out of memory [NV_ERR_NO_MEMORY] (0x00000051) returned from _memdescAllocInternal(pMemDesc) @ mem_desc.c:1353
[28157.273628] NVRM: faultbufCtrlCmdMmuFaultBufferRegisterNonReplayBuf_IMPL: Error allocating client shadow fault buffer for non-replayable faults
[28158.257236] NVRM: nvCheckOkFailedNoLog: Check failed: Out of memory [NV_ERR_NO_MEMORY] (0x00000051) returned from _memdescAllocInternal(pMemDesc) @ mem_desc.c:1353
[28158.271863] NVRM: faultbufCtrlCmdMmuFaultBufferRegisterNonReplayBuf_IMPL: Error allocating client shadow fault buffer for non-replayable faults
[28182.958643] NVRM: nvCheckOkFailedNoLog: Check failed: Out of memory [NV_ERR_NO_MEMORY] (0x00000051) returned from _memdescAllocInternal(pMemDesc) @ mem_desc.c:1353
[28182.973267] NVRM: faultbufCtrlCmdMmuFaultBufferRegisterNonReplayBuf_IMPL: Error allocating client shadow fault buffer for non-replayable faults
]$ df -k /
Filesystem 1K-blocks Used Available Use% Mounted on
none 473088 390860 82228 83% /
]$ uptime
23:37:41 up 8:18, load average: 21.30, 23.85, 26.89
]$ head -3 /proc/meminfo
MemTotal: 32328040 kB
MemFree: 562976 kB
MemAvailable: 357008 kB
After :
]$ dmesg | grep -i NVRM
[ 284.005891] NVRM: loading NVIDIA UNIX Open Kernel Module for x86_64 575.64.05 Release Build (dvs-builder@U22-A23-13-1) Fri Jul 18 16:00:10 UTC 2025
[27877.210663] NVRM: nvCheckOkFailedNoLog: Check failed: Out of memory [NV_ERR_NO_MEMORY] (0x00000051) returned from _memdescAllocInternal(pMemDesc) @ mem_desc.c:1353
[27877.225294] NVRM: faultbufCtrlCmdMmuFaultBufferRegisterNonReplayBuf_IMPL: Error allocating client shadow fault buffer for non-replayable faults
[27877.601371] NVRM: nvCheckOkFailedNoLog: Check failed: Out of memory [NV_ERR_NO_MEMORY] (0x00000051) returned from _memdescAllocInternal(pMemDesc) @ mem_desc.c:1353
[27877.616030] NVRM: sysmemConstruct_IMPL: *** Cannot allocate sysmem through fb heap
[27877.623639] NVRM: nvAssertOkFailedNoLog: Assertion failed: Out of memory [NV_ERR_NO_MEMORY] (0x00000051) returned from pRmApi->Alloc(pRmApi, device->session->handle, isSystemMemory ? device->handle : device->subhandle, &physHandle, isSystemMemory ? NV01_MEMORY_SYSTEM : NV01_MEMORY_LOCAL_USER, &memAllocParams, sizeof(memAllocParams)) @ nv_gpu_ops.c:4647
[27878.531209] NVRM: nvCheckOkFailedNoLog: Check failed: Out of memory [NV_ERR_NO_MEMORY] (0x00000051) returned from _memdescAllocInternal(pMemDesc) @ mem_desc.c:1353
[27878.545826] NVRM: faultbufCtrlCmdMmuFaultBufferRegisterNonReplayBuf_IMPL: Error allocating client shadow fault buffer for non-replayable faults
[27878.601580] NVRM: nvCheckOkFailedNoLog: Check failed: Out of memory [NV_ERR_NO_MEMORY] (0x00000051) returned from _memdescAllocInternal(pMemDesc) @ mem_desc.c:1353
[27878.616207] NVRM: faultbufCtrlCmdMmuFaultBufferRegisterNonReplayBuf_IMPL: Error allocating client shadow fault buffer for non-replayable faults
[27880.102423] NVRM: nvCheckOkFailedNoLog: Check failed: Out of memory [NV_ERR_NO_MEMORY] (0x00000051) returned from _memdescAllocInternal(pMemDesc) @ mem_desc.c:1353
[27880.117054] NVRM: faultbufCtrlCmdMmuFaultBufferRegisterNonReplayBuf_IMPL: Error allocating client shadow fault buffer for non-replayable faults
[27900.022239] NVRM: nvCheckOkFailedNoLog: Check failed: Out of memory [NV_ERR_NO_MEMORY] (0x00000051) returned from _memdescAllocInternal(pMemDesc) @ mem_desc.c:1353
[27900.036867] NVRM: faultbufCtrlCmdMmuFaultBufferRegisterNonReplayBuf_IMPL: Error allocating client shadow fault buffer for non-replayable faults
[28156.315466] NVRM: nvCheckOkFailedNoLog: Check failed: Out of memory [NV_ERR_NO_MEMORY] (0x00000051) returned from _memdescAllocInternal(pMemDesc) @ mem_desc.c:1353
[28156.330119] NVRM: faultbufCtrlCmdMmuFaultBufferRegisterNonReplayBuf_IMPL: Error allocating client shadow fault buffer for non-replayable faults
[28156.551884] NVRM: nvCheckOkFailedNoLog: Check failed: Out of memory [NV_ERR_NO_MEMORY] (0x00000051) returned from _memdescAllocInternal(pMemDesc) @ mem_desc.c:1353
[28156.566518] NVRM: faultbufCtrlCmdMmuFaultBufferRegisterNonReplayBuf_IMPL: Error allocating client shadow fault buffer for non-replayable faults
[28157.186096] NVRM: nvCheckOkFailedNoLog: Check failed: Out of memory [NV_ERR_NO_MEMORY] (0x00000051) returned from _memdescAllocInternal(pMemDesc) @ mem_desc.c:1353
[28157.200726] NVRM: faultbufCtrlCmdMmuFaultBufferRegisterNonReplayBuf_IMPL: Error allocating client shadow fault buffer for non-replayable faults
[28157.258996] NVRM: nvCheckOkFailedNoLog: Check failed: Out of memory [NV_ERR_NO_MEMORY] (0x00000051) returned from _memdescAllocInternal(pMemDesc) @ mem_desc.c:1353
[28157.273628] NVRM: faultbufCtrlCmdMmuFaultBufferRegisterNonReplayBuf_IMPL: Error allocating client shadow fault buffer for non-replayable faults
[28158.257236] NVRM: nvCheckOkFailedNoLog: Check failed: Out of memory [NV_ERR_NO_MEMORY] (0x00000051) returned from _memdescAllocInternal(pMemDesc) @ mem_desc.c:1353
[28158.271863] NVRM: faultbufCtrlCmdMmuFaultBufferRegisterNonReplayBuf_IMPL: Error allocating client shadow fault buffer for non-replayable faults
[28182.958643] NVRM: nvCheckOkFailedNoLog: Check failed: Out of memory [NV_ERR_NO_MEMORY] (0x00000051) returned from _memdescAllocInternal(pMemDesc) @ mem_desc.c:1353
[28182.973267] NVRM: faultbufCtrlCmdMmuFaultBufferRegisterNonReplayBuf_IMPL: Error allocating client shadow fault buffer for non-replayable faults
]$ df -k /
Filesystem 1K-blocks Used Available Use% Mounted on
none 473088 390860 82228 83% /
]$ uptime
23:50:18 up 8:31, load average: 33.62, 35.05, 32.14
]$ head -3 /proc/meminfo
MemTotal: 32328040 kB
MemFree: 6922760 kB
MemAvailable: 6712488 kB
I unloaded model and execute :
mount -o remount,size=800M /
I reloaded the model again in Ollama, without any change.
]$ dmesg | grep -i NVRM
[ 284.005891] NVRM: loading NVIDIA UNIX Open Kernel Module for x86_64 575.64.05 Release Build (dvs-builder@U22-A23-13-1) Fri Jul 18 16:00:10 UTC 2025
[27877.210663] NVRM: nvCheckOkFailedNoLog: Check failed: Out of memory [NV_ERR_NO_MEMORY] (0x00000051) returned from _memdescAllocInternal(pMemDesc) @ mem_desc.c:1353
[27877.225294] NVRM: faultbufCtrlCmdMmuFaultBufferRegisterNonReplayBuf_IMPL: Error allocating client shadow fault buffer for non-replayable faults
[27877.601371] NVRM: nvCheckOkFailedNoLog: Check failed: Out of memory [NV_ERR_NO_MEMORY] (0x00000051) returned from _memdescAllocInternal(pMemDesc) @ mem_desc.c:1353
[27877.616030] NVRM: sysmemConstruct_IMPL: *** Cannot allocate sysmem through fb heap
[27877.623639] NVRM: nvAssertOkFailedNoLog: Assertion failed: Out of memory [NV_ERR_NO_MEMORY] (0x00000051) returned from pRmApi->Alloc(pRmApi, device->session->handle, isSystemMemory ? device->handle : device->subhandle, &physHandle, isSystemMemory ? NV01_MEMORY_SYSTEM : NV01_MEMORY_LOCAL_USER, &memAllocParams, sizeof(memAllocParams)) @ nv_gpu_ops.c:4647
[27878.531209] NVRM: nvCheckOkFailedNoLog: Check failed: Out of memory [NV_ERR_NO_MEMORY] (0x00000051) returned from _memdescAllocInternal(pMemDesc) @ mem_desc.c:1353
[27878.545826] NVRM: faultbufCtrlCmdMmuFaultBufferRegisterNonReplayBuf_IMPL: Error allocating client shadow fault buffer for non-replayable faults
[27878.601580] NVRM: nvCheckOkFailedNoLog: Check failed: Out of memory [NV_ERR_NO_MEMORY] (0x00000051) returned from _memdescAllocInternal(pMemDesc) @ mem_desc.c:1353
[27878.616207] NVRM: faultbufCtrlCmdMmuFaultBufferRegisterNonReplayBuf_IMPL: Error allocating client shadow fault buffer for non-replayable faults
[27880.102423] NVRM: nvCheckOkFailedNoLog: Check failed: Out of memory [NV_ERR_NO_MEMORY] (0x00000051) returned from _memdescAllocInternal(pMemDesc) @ mem_desc.c:1353
[27880.117054] NVRM: faultbufCtrlCmdMmuFaultBufferRegisterNonReplayBuf_IMPL: Error allocating client shadow fault buffer for non-replayable faults
[27900.022239] NVRM: nvCheckOkFailedNoLog: Check failed: Out of memory [NV_ERR_NO_MEMORY] (0x00000051) returned from _memdescAllocInternal(pMemDesc) @ mem_desc.c:1353
[27900.036867] NVRM: faultbufCtrlCmdMmuFaultBufferRegisterNonReplayBuf_IMPL: Error allocating client shadow fault buffer for non-replayable faults
[28156.315466] NVRM: nvCheckOkFailedNoLog: Check failed: Out of memory [NV_ERR_NO_MEMORY] (0x00000051) returned from _memdescAllocInternal(pMemDesc) @ mem_desc.c:1353
[28156.330119] NVRM: faultbufCtrlCmdMmuFaultBufferRegisterNonReplayBuf_IMPL: Error allocating client shadow fault buffer for non-replayable faults
[28156.551884] NVRM: nvCheckOkFailedNoLog: Check failed: Out of memory [NV_ERR_NO_MEMORY] (0x00000051) returned from _memdescAllocInternal(pMemDesc) @ mem_desc.c:1353
[28156.566518] NVRM: faultbufCtrlCmdMmuFaultBufferRegisterNonReplayBuf_IMPL: Error allocating client shadow fault buffer for non-replayable faults
[28157.186096] NVRM: nvCheckOkFailedNoLog: Check failed: Out of memory [NV_ERR_NO_MEMORY] (0x00000051) returned from _memdescAllocInternal(pMemDesc) @ mem_desc.c:1353
[28157.200726] NVRM: faultbufCtrlCmdMmuFaultBufferRegisterNonReplayBuf_IMPL: Error allocating client shadow fault buffer for non-replayable faults
[28157.258996] NVRM: nvCheckOkFailedNoLog: Check failed: Out of memory [NV_ERR_NO_MEMORY] (0x00000051) returned from _memdescAllocInternal(pMemDesc) @ mem_desc.c:1353
[28157.273628] NVRM: faultbufCtrlCmdMmuFaultBufferRegisterNonReplayBuf_IMPL: Error allocating client shadow fault buffer for non-replayable faults
[28158.257236] NVRM: nvCheckOkFailedNoLog: Check failed: Out of memory [NV_ERR_NO_MEMORY] (0x00000051) returned from _memdescAllocInternal(pMemDesc) @ mem_desc.c:1353
[28158.271863] NVRM: faultbufCtrlCmdMmuFaultBufferRegisterNonReplayBuf_IMPL: Error allocating client shadow fault buffer for non-replayable faults
[28182.958643] NVRM: nvCheckOkFailedNoLog: Check failed: Out of memory [NV_ERR_NO_MEMORY] (0x00000051) returned from _memdescAllocInternal(pMemDesc) @ mem_desc.c:1353
[28182.973267] NVRM: faultbufCtrlCmdMmuFaultBufferRegisterNonReplayBuf_IMPL: Error allocating client shadow fault buffer for non-replayable faults
[31392.811153] NVRM: nvCheckOkFailedNoLog: Check failed: Out of memory [NV_ERR_NO_MEMORY] (0x00000051) returned from _memdescAllocInternal(pMemDesc) @ mem_desc.c:1353
[31392.825783] NVRM: faultbufCtrlCmdMmuFaultBufferRegisterNonReplayBuf_IMPL: Error allocating client shadow fault buffer for non-replayable faults
[31393.035352] NVRM: nvCheckOkFailedNoLog: Check failed: Out of memory [NV_ERR_NO_MEMORY] (0x00000051) returned from _memdescAllocInternal(pMemDesc) @ mem_desc.c:1353
[31393.049973] NVRM: faultbufCtrlCmdMmuFaultBufferRegisterNonReplayBuf_IMPL: Error allocating client shadow fault buffer for non-replayable faults
[31395.347200] NVRM: nvCheckOkFailedNoLog: Check failed: Out of memory [NV_ERR_NO_MEMORY] (0x00000051) returned from _memdescAllocInternal(pMemDesc) @ mem_desc.c:1353
[31395.361828] NVRM: faultbufCtrlCmdMmuFaultBufferRegisterNonReplayBuf_IMPL: Error allocating client shadow fault buffer for non-replayable faults
[31395.438280] NVRM: nvCheckOkFailedNoLog: Check failed: Out of memory [NV_ERR_NO_MEMORY] (0x00000051) returned from _memdescAllocInternal(pMemDesc) @ mem_desc.c:1353
[31395.452912] NVRM: faultbufCtrlCmdMmuFaultBufferRegisterNonReplayBuf_IMPL: Error allocating client shadow fault buffer for non-replayable faults
[31403.016203] NVRM: nvCheckOkFailedNoLog: Check failed: Out of memory [NV_ERR_NO_MEMORY] (0x00000051) returned from _memdescAllocInternal(pMemDesc) @ mem_desc.c:1353
[31403.030848] NVRM: faultbufCtrlCmdMmuFaultBufferRegisterNonReplayBuf_IMPL: Error allocating client shadow fault buffer for non-replayable faults
]$ df -k /
Filesystem 1K-blocks Used Available Use% Mounted on
none 819200 390860 428340 48% /
]$ uptime
00:21:08 up 9:02, load average: 28.42, 28.40, 31.70
]$ head -3 /proc/meminfo
MemTotal: 32328040 kB
MemFree: 6029652 kB
MemAvailable: 5823852 kB
Tja, es sieht so aus, als lag ich mit meiner Vermutung falsch.
Das Remount hat genau das getan, was es sollte: Begrenzung von 462 MiB → 800 MiB, 83% → 48%, 418 MiB frei. Und die NVRM-Fehler haben sich weiter angesammelt, wie im Burst bei Uptime 8:43 (t=31392–31403) zu sehen, direkt nach der 8:31-Probe.
Was aus diesen Logs klar hervorgeht: Deine System-RAM-Situation ist ernst. MemTotal 30,8 GiB, MemAvailable 349 MiB beim ersten Sample. Das sind 1,1% verfügbar auf einem 48-GB-Gerät, nachdem ZFX deinem Speicher zusetzt. Das 381-MiB-Ramdisk ist dagegen praktisch ein Rundungsfehler. Ich hatte anfangs viele Probleme auf meinem TVS-AIH1688ATX wegen zu wenig RAM und habe irgendwann kapituliert und mehr gekauft. QNAP Support hat, muss ich sagen, nie ein Wort über das zusätzliche RAM verloren und trotzdem hervorragenden Support geleistet. Ob das deine Probleme löst, weiß ich nicht, aber ich teile einfach meine eigene Erfahrung.
Ich denke, es ist Zeit, ein Helpdesk-Ticket zu eröffnen und technischen Support anzufordern.
Viel Glück und halt uns auf dem Laufenden!
Die Speicherinformationen, die @achimede333 angibt, scheinen ziemlich normal zu sein. Mein TVS-672XT hat 32 GB Speicher, und wenn ich head 03 /proc/meminfo ausführe, bekomme ich ungefähr die gleiche Menge an Speicher.

Interessant wird es jetzt im Resource Monitor, denn dort sieht es anders aus:
Hier wird angezeigt, dass ich 11 GB frei habe und nicht 6.
Ich nutze nur etwa 4 GB Swap-Speicher.
Ich nehme an, die Moral der Geschichte ist: Wenn du große Sprachmodelle auf deinem NAS laufen lassen möchtest, brauchst du VIEL Speicher.
QuTShero hat ein Problem mit dem ZFS ARC.
Hallo euch beiden,
In meiner vorherigen Nachricht waren die NVIDIA-Treiber schon fehlerhaft, bevor ich ein Modell auf Ollama verwendet habe.
Seit dem Reset stelle ich Dateien wieder her und konfiguriere neu – das ist ziemlich viel Arbeit für mich.
Das kann einen Einfluss haben. Monitoring mit entsprechender Überwachung könnte hierbei helfen.
Ich habe tatsächlich seit dem Kauf 32 GB RAM, und angesichts der aktuellen Preise kann ich mir leider kein weiteres kaufen ![]()
Schon vor dem Reset habe ich nachts mehrfach Nachrichten erhalten, dass das NAS keinen Speicher mehr hatte, ohne irgendwelche Gründe zu wissen (zum Beispiel ohne Ollama zu benutzen – ich weiß, dass das von woanders kommen muss, aber das wollte ich klarstellen).
Danach findet man einige Fehlerspuren („[NV_ERR_NO_MEMORY] (0x00000051) returned from _memdescAllocInternal(pMemDesc) @ mem_desc.c:1353…“) im Internet, die direkt an den NVIDIA-Treibern liegen, aber ihr scheint dieses Problem nicht zu haben mit eurem System, das mehr RAM hat.
Wir werden sehen, wie es weitergeht. Was die Überwachung angeht, denke ich aber, dass ich aktuell keine Zeit haben werde, mich mit dem Thema auseinanderzusetzen (irgendwann sicher).
Du kannst die maximale ARC-RAM-Nutzung senken. Mit 50 % habe ich keine Probleme.
Warum ist die RAM-Auslastung in QuTS hero so hoch? | QNAP
Danke, das kann ich testen.
Allerdings habe ich diese Nachrichten erst nach Einbruch der Dunkelheit entdeckt. Es war definitiv eine Wartungs-/nächtliche Aktion, die dazu geführt hat.
Edit:
Nach dem Überprüfen könnte ich ein paar Bars finden, die nicht „sehr“ (das ist relativ :)) teuer sind.
@kzboray Was hast du auf deiner Seite eingebaut?
Ich habe „KSM56E46BD8KM‐48HM“ gefunden, muss aber noch den Verkäufer prüfen.
Im Moment habe ich ein „TS4GLA72V8E“.
Ich habe diese bei Newegg.com bestellt. Sie kamen mit lebenslanger Garantie, was mir gefallen hat. Außerdem wollte ich keine verschiedenen Anbieter und Speichertimings mischen, also habe ich die originalen UDIMM entfernt und zwei neue Riegel installiert.
Zuerst habe ich ein Set bestellt und geprüft, ob sie funktionieren und der NAS beim POST besteht. Das war der Fall, also habe ich ein zweites Set für insgesamt 192GB bestellt. Beim ersten Booten nach der Installation der ersten beiden Riegel hat der NAS etwa 5 Minuten gebraucht, um den POST mit Speichervalidierung durchzuführen.
Es sah interessant aus, besonders vor der Preiserhöhung…
Diese Marke richtet sich wirklich an die amerikanischen Kunden.
Ich denke, das gilt für ECC on-die.
In Europa scheint es PHS-Memory zu geben, aber ich kenne nur die großen Marken (Kingston, Corsair, Crucial, HPE, Samsung usw.).
Der Speicher, den ich von NEMIX erhalten habe, wurde als Micron-Speicher erkannt und verfügt über ECC on-die. Ich kann nicht behaupten, dass sie ausschließlich Micron ausliefern, aber beide Sets mit jeweils zwei Modulen, die ich im Abstand von einem Monat gekauft habe, waren identische Micron-UDIMMs.