Zum Inhalt springen

Lieferung in alle 27 EU-Länder · Keine Zollgebühren innerhalb der EU · 1 Jahr Garantie

Fehlersuche am Mining-Rig (Hardware & HiveOS-Software)

geradeaus Romain Schlick

Ein Rig, das abstürzt, eine Grafikkarte, die verschwindet, ein Miner, der ständig neu startet: Das sind die häufigsten Störungen beim GPU-Mining, und sie können Stunden kosten. In diesem Video von 2021 (auf Französisch) zeigen wir Ihnen, wie man die Ursache methodisch findet, zuerst bei der Hardware, dann bei der Software mit den Werkzeugen von HiveOS: Dashboard, Miner-Logs, Watchdog und Kommandozeile.

1. Hardware: das Problem eingrenzen

Unser Beispiel ist ein Rig mit 8 RTX 3070 ohne LHR, versorgt von zwei Netzteilen. Der richtige Reflex: nicht alles gleichzeitig untersuchen, sondern die Zahl der möglichen Ursachen verringern. Man trennt das zweite Netzteil und lässt das Rig nur mit den 4 Karten des ersten laufen. Bleibt es stabil, liegt das Problem bei den anderen 4 Karten; stürzt es weiterhin ab, liegt es am ersten Strang.

Danach prüft man die empfindlichsten Teile:

  • Die LEDs der Riser: Sie zeigen die Versorgung mit 12 V und 3,3 V an. Die blaue und die rote LED müssen leuchten.
  • Die Riser selbst: Sie sind Verbrauchsmaterial und kosten 5 bis 7 €. Macht eine Karte Probleme, tauscht man ohne Zögern ihren Riser.
  • Die Anschlüsse: Jedes Kabel und jeder Stecker muss richtig sitzen.

2. Wenn die Hardware nicht schuld ist: das Übertakten

In einer Nacht verbrachten wir drei Stunden mit einem neuen Rig, das zu minen begann und dann abstürzte. Wir trennten ein Netzteil, um nur 4 Karten zu behalten: Das Problem blieb. Wir tauschten das Mainboard, dann die Riser: immer noch derselbe Fehler. Die Grafikkarten waren neu. Die Hardware war nicht schuld: Das Problem kam vom Übertakten.

Unserer Erfahrung nach steckt hinter einem Rig, das eine Weile mint und dann abstürzt, oft eine zu aggressive Übertaktung. In diesem Fall war der Speicher die Ursache: Auf derselben GPU, hier der RTX 3070, kann Speicher verschiedener Marken verbaut sein. Wir waren Karten ohne LHR mit Samsung-Speicher gewohnt, der eine Speicherübertaktung von mindestens 2400, sogar 2600 bis 2700 verträgt. Bei den LHR-Modellen verbauen die Hersteller oft einen anderen Speicher, den wir für weniger hochwertig halten und der sich zwischen 1400 und 1700 einstellen lässt, höchstens 1800. Eine für Samsung-Speicher gedachte Einstellung lässt diese Karten daher abstürzen.

3. Das Rig in HiveOS überwachen

Auf der Worker-Seite helfen mehrere Anzeigen, ein Problem zu erkennen:

  • Die Temperaturen: Bei NVIDIA-Karten zeigt HiveOS nur die GPU-Temperatur an, nicht die des Speichers, obwohl gerade er oft die Abstürze verursacht. AMD-Karten melden die Speichertemperatur dagegen. Die RTX 3080 und 3090 mit GDDR6X haben häufig Probleme mit der Speicherhitze.
  • Die Meldungen: Ein Bereich sammelt Konfigurationsänderungen, Warnungen und Fehler. Man sollte ihn regelmäßig ansehen.
  • Die Kartentabelle: Temperaturen, Lüfterdrehzahl und Verbrauch jeder GPU.
  • Der Load Average: Er misst die Auslastung des Prozessors. Bei unserem Rig liegt er bei 0,28 in der letzten Minute und bei 0,16 im Durchschnitt der letzten 15 Minuten, was normal ist. Er sollte die Zahl der CPU-Kerne mal 2 nicht überschreiten.

Wer tiefer gehen will, findet im Menü Miners, dann Action und Miner log, die Ausgabe der Mining-Software. Dort sieht man die Fehler, die einem Absturz vorausgehen.

4. Neustarts mit dem Watchdog automatisieren

Der Watchdog, „der Hund, der aufpasst“, startet den Miner oder das Rig automatisch neu, wenn eine Bedingung erfüllt ist. Man kann zum Beispiel:

  • den Miner nach drei Minuten neu starten, wenn er ein Problem erkennt;
  • das Rig nach einer bestimmten Anzahl von Minuten neu booten;
  • neu booten, wenn der Load Average einen Schwellenwert überschreitet;
  • die Hashrate überwachen: Fällt T-Rex unter 250 MH/s, stimmt etwas nicht, und der Watchdog startet den Miner neu.

Wir hatten ein Rig, das alle 5, 10 oder 15 Stunden abstürzte, und fanden die Ursache einige Wochen lang nicht. Mit dem Watchdog startete das Rig von selbst wieder, was die verlorene Mining-Zeit während der Suche begrenzte. Die Ursache war schließlich der Speicher der Karten vom Typ RTX 3080, der zu heiß wurde und den Miner abstürzen ließ: ein Klassiker.

5. Die Kommandozeile für eine genaue Diagnose

In HiveOS öffnet Remote access und dann Hive Shell Start eine Kommandozeile, als wäre man direkt am Rig angeschlossen. Einige nützliche Befehle:

  • net-test: prüft die Verbindung zu den HiveOS-Servern und ob es ein Proxy-Problem gibt;
  • miner log: zeigt die Ausgabe des Miners, darunter den Anteil gültiger Shares;
  • nvidia-info: listet die NVIDIA-GPUs auf, nummeriert ab 0;
  • gpu-fans-find mit der Nummer der Karte: lässt ihre Lüfter drehen, damit man die Karte im Rig physisch erkennt;
  • top: zeigt die Prozessor- und Speichernutzung jedes Prozesses (Shift + P sortiert nach Prozessor, Shift + M nach Speicher).

Behalten Sie schließlich die Shares im Blick: Der Anteil gültiger Shares sollte bei etwa 98 bis 99 % liegen. Darunter hat eine Karte ein echtes Problem, durch Übertaktung oder Hardware.

Und heute?

Seit Ethereum im September 2022 auf Proof of Stake umgestellt hat, lässt sich Ethereum nicht mehr mit Grafikkarten minen, und GPU-Rigs sind zur Randerscheinung geworden. Die Methode gilt weiterhin für jede Mining-Maschine: die Komponenten einzeln eingrenzen, Temperaturen und Logs überwachen und Neustarts automatisieren, während man die Ursache sucht.

Um HiveOS richtig einzurichten, sehen Sie sich unser HiveOS-Tutorial (Worker, Übertaktung, Flight Sheet) an und finden Sie alle unsere Videos auf der Tutorial-Seite. Sie steigen auf ASIC-Miner um? Unser Team berät Sie gern: Kontaktieren Sie uns.

Vorheriger Artikel
Nächster Artikel

Danke, dass Sie sich angemeldet haben!

Diese E-Mail wurde gespeichert!

Kaufe den Look

Wählen Sie die Optionen

Option ändern
Back In Stock Notification

Wählen Sie die Optionen

this is just a warning
Anmelden
Warenkorb
0 Artikel