ich habe große Schwierigkeiten, Snapshots zwischen zwei QNAP TS435XeU zu replizieren; das Sync läuft für nur 5 TB Daten bereits über einen Tag.
Grundlegende Infos zur Umgebung:
Direkte Ethernet-Verbindung zwischen den Geräten mit einem brandneuen Cat.6-Kabel, 1 Meter lang; beide Geräte melden einen 2,5-Gb-Link (mit einem 2,5G-Switch dazwischen ergibt sich das gleiche Ergebnis)
Die Quell-Einheit hat 4x4TB-Festplatten in RAID5-Konfiguration
Die Ziel-Einheit hat eine einzelne 8TB-Festplatte (das zu kopierende Volume ist 5TB groß und passt also auf das Ziel)
Alle Festplatten sind WD NAS-Modelle
Beide Geräte haben die aktuellste verfügbare Firmware installiert
Für den Sync-Prozess gibt es keine Geschwindigkeitsbegrenzung, keine Verschlüsselung, keine Kompression
Rein rechnerisch sollten 5TB bei 2,5Gbps in etwa 5 Stunden durch sein, also wäre ich mit Überkopf, Fehlern, Zauberern, Echsen und Märchen auch mit einer 10-stündigen Übertragungszeit zufrieden – aber nach über einem Tag liegt der Fortschritt nur bei mickrigen 26,92% (es werden 4TB in 27 Stunden gemeldet, das sind keine 25%…)
Ich sehe, dass dieses Problem öfter aufzutreten scheint…
Gibt es etwas Offensichtliches, das ich beim Einrichten des Prozesses übersehen haben könnte?
Wie hoch ist die CPU-Auslastung während des Prozesses? Diese Geräte sind ja berüchtigt für ihre geringe Leistung. Welches Festplattenmodell wird verwendet?
Die CPU ist größtenteils im Leerlauf; sie hat einen Ausschlag, wenn ich mich einlogge, um den Status zu überprüfen, aber nach ein paar Sekunden geht sie auf 10–20% beim Quellgerät und unter 10% beim Ziel-NAS zurück.
Alle Festplatten sind WD Red:
4x WD40EFPX-68C6CN0
1x WD80EFPX-68C4ZN0
Das Problem, das mir extrem seltsam erscheint, ist, dass der Datentransfer im Netzwerk nicht konstant ist: Es gibt Spitzen von 500/700 Mbit/s für eine halbe Stunde, dann stoppt er komplett für eine Weile und setzt dann wieder ein.
Ich konnte bisher keinen Zusammenhang im Timing erkennen – weder bezüglich Geschwindigkeit noch bezüglich der übertragenen Datenmenge.
Es sieht so aus, als würden beide Geräte die meiste Zeit im Leerlauf stehen, und ich verstehe nicht, warum.
Nebenbei bemerkt: Als ich gestern meinen Beitrag geschrieben habe, hatte ich gerade die Snapshot-Replikation komplett neugestartet (Volume auf dem Ziel-NAS gelöscht, beide Geräte neu gestartet, Job neu gestartet) und nach 20 Stunden steht sie bei 17,56 %. In diesem Moment beträgt die Übertragungsgeschwindigkeit im Netzwerk (direkte 2,5-Gbit/s-Verbindung, keine Firewall, kein Switch) 33 kbit/s.
Aus meiner persönlichen Erfahrung dauert das erste Snapshot-Replica in der Regel länger, aber die folgenden sollten deutlich schneller sein. Die von dir erwähnte Geschwindigkeit erscheint mir allerdings ungewöhnlich, daher lasse ich unser internes Team das analysieren und prüfen, ob es irgendwelche Probleme gibt. Danke für die Info!
Die CPU-Auslastung sagt wenig aus. Was du dir anschauen solltest, ist die CPU-Last („Load Average“) in TOP. Um darauf zuzugreifen, logge dich per SSH-Verbindung auf deinem NAS ein und führe dann den Befehl „top“ aus. Du wirst dann so etwas sehen wie:
Der Wert bei „Load average“ ist entscheidend. Er zeigt grob an, wie viele Threads deine CPU in den letzten 1, 5 und 15 Minuten bearbeitet hat. Dein NAS hat eine 4-Kern-CPU. Das heißt: Wenn dein Wert dauerhaft über 4 liegt (zum Beispiel bei 8 oder 10), hast du einen Flaschenhals und alles wird langsamer. Diese Prozesse beanspruchen vielleicht wenig CPU-Ressourcen, laufen aber trotzdem und verlangsamen das System. Jeder CPU-Kern kann immer nur eine Sache gleichzeitig abarbeiten. Gibt es viele zusätzliche Prozesse, die in der Warteschlange stehen, wird alles langsamer.
Gerade die Erstellung des ersten Snapshots dürfte recht viele Ressourcen brauchen – besonders wenn auf dem NAS noch andere Sachen laufen.
Ich habe leider vorher nicht überprüft, ob es ein Update gibt; ich habe die Geräte bereits mit einer neuen Version von der QNAP-Website aktualisiert (im QTS war kein Update verfügbar), und bisher liegt die Last unter 4.
Es gibt Ausschläge, die ich einer Verbindung zur Weboberfläche zuordne: Wenn ich QTS öffne, sehe ich, wie die Last ansteigt, aber das ist meiner Meinung nach zu erwarten.
Falls irgendetwas nicht in Ordnung war, wurde es durch das neueste OS-Update behoben; jetzt läuft der Sync stabil, keine Geschwindigkeitsschwankungen mehr von 150MB/s auf null und dann Stillstand.
…und da bin ich wieder zurück, weil aus irgendeinem Grund das Snapshot-Replica nur mit einer direkten Kabelverbindung funktioniert…
Es ist keine plötzliche Unterbrechung; seit Mai habe ich an dem Problem gearbeitet und ein weiteres Ticket bei QNAP eröffnet, aber der aktuelle Stand ist, dass das Snapshot-Replica funktioniert, wenn eine direkte Verbindung zwischen den beiden Geräten besteht. Sobald ich jedoch einen Switch dazwischen setze (Managed Switch, 2 Ports im selben VLAN, 2 IPs im selben Subnetz, kein Router dazwischen), schlägt das Snapshot-Replica fehl.
Das Ziel ist, das Replica über ein VPN laufen zu lassen, deshalb habe ich das ebenfalls getestet – aber auch über VPN schlägt das Snapshot-Replica fehl.
Was mich irritiert: Ein stündlich geplanter HBS3 Active Sync-Job funktioniert auf dem selben Link einwandfrei: gleiche Geräte, gleiche Verbindung, gleiche IP-Adressen, HBS3 funktioniert, Snapshot-Replica schlägt fehl.
Man könnte argumentieren, dass das HBS3 Active Sync deutlich weniger Daten überträgt. Ich mache dazu gerade noch weitere Tests mit unterschiedlichen Datenmengen.
Meine Replikas laufen über ein ganz normales Netzwerk und funktionieren einwandfrei. Irgendetwas stimmt bei dir in der Einrichtung oder im Netzwerk nicht.
Ich habe diese zwei QNAP-Geräte und wenn sie mit einem Cat6-Kabel direkt verbunden sind, funktioniert die Replikation einwandfrei.
Wenn ich das direkte Kabel entferne und einen Switch mit zwei Kabeln anschließe, jeweils eins zu jedem QNAP, schlägt die Replikation mit dem Fehler „Remote Disconnection“ fehl (keine Änderung in der Netzwerkkonfiguration, beide QNAPs bleiben im gleichen IP-Subnetz wie zuvor, kein Router/Firewall/Filter zwischen den Geräten).
Ich habe verschiedene Switches ausprobiert, um einen Defekt auszuschließen (HPE 1930, BDCOM S2500) und mehrere Kabel verwendet.
Folgende Infos habe ich zum Fehler:
Im Quell-QNAP-Log gibt es keinen Eintrag zur Netzunterbrechung
Im Ziel-QNAP-Log gibt es keinen Eintrag zur Netzunterbrechung
Switch-Monitoring erkennt keine Netzunterbrechung
Das MRTG-Traffic-Graph ist extrem ungewöhnlich: nur wenige Peak-Transfers und ansonsten fast durchgehend flache bzw. nahe Null liegende Werte
Quell-Daten ca. 6 TB auf einem ca. 10 TB Storage-Pool
Ziel-Pool über 15 TB, exklusiv für diesen Vorgang, keine anderen Daten auf dem Gerät
Verwendest du also für das andere NAS einen Domainnamen oder eine IP-Adresse?
Befinden sich beide IP-Adressen im gleichen Subnetz? Gibt es irgendwelche VLANs oder Routing zwischen den beiden NAS-Geräten?
Es wäre gut, mal eine iPerf-Verbindung zwischen den beiden NAS-Geräten auszuprobieren. Du kannst das MyQNAP.org-App-Repository zu deinem App Center hinzufügen. Lade die iPerf3-App herunter und starte sie. Das musst du über die Befehlszeile machen.
Du scheinst hier ziemlich technisch versiert zu sein, also gebe ich dir keine Schritt-für-Schritt-Anleitung dazu. Wenn du sie brauchst, sag aber gerne Bescheid.
Ein iPerf-Test zwischen den beiden NAS-Geräten sollte zeigen, wie schnell die Verbindung tatsächlich ist…
Alle Verbindungen werden über IP-Adressen hergestellt.
Die Geräte befinden sich im selben IP-Subnetz: Ich habe das gerade Kabel entfernt und einen Switch eingesetzt, das war’s – kein Router/Firewall dazwischen.
Auf dem Switch sind die Ports in einem eigenen VLAN, nur die QNAPs befinden sich in diesem VLAN.
iperf zeigt 1 Gbit an:
Der nächste Schritt wird alles sauber zu löschen und neu zu starten, aber das wird echt nervig, weil ich die Backups während des Löschens woanders unterbringen muss…
Es sieht so aus, als gäbe es keine Hinweise im Log auf die Ursache des Fehlers: Die Fehlerquelle ist „remote disconnection“, aber auf der Gegenseite wird nichts protokolliert, die physische Verbindung ist in Ordnung, das QNAP-Protokoll meldet keine Trennung.
Hier ist die Quelle:
Der QNAP-Support hat mir gerade eine Zusammenfassung geschickt, die von IA erstellt wurde, über den Unterschied zwischen einer direkten Kabelverbindung und einer Verbindung über einen Switch, und sie werden sich wieder melden, um die Routing-Einstellungen zu prüfen…
Sie werden mich kontaktieren, um das Routing zwischen Node 10.10.10.1/24 und Node 10.10.10.2/24 zu überprüfen.
Routing.
Im selben Subnetz.
Mein bester Plan ist immer noch ein kompletter Reset und etwas Glück beim nächsten Versuch.