Ir al contenido

Envío a los 27 países de la UE · Sin aranceles dentro de la UE · Garantía de 1 año

Depurar tu rig de minería (hardware y software HiveOS)

por Romain Schlick

Un rig que se cuelga, una tarjeta gráfica que desaparece, un minero que se reinicia una y otra vez: son las averías más habituales en la minería con GPU y pueden hacer perder horas. En este vídeo de 2021 (en francés), te mostramos cómo encontrar su origen con método, primero en el hardware y después en el software, con las herramientas de HiveOS: panel, registros del minero, watchdog y línea de comandos.

1. Hardware: aislar el problema

Nuestro ejemplo es un rig de 8 RTX 3070 no LHR, alimentado por dos fuentes de alimentación. El buen reflejo: no examinarlo todo a la vez, sino reducir el número de elementos sospechosos. Se desconecta la segunda fuente y se hace funcionar el rig solo con las 4 tarjetas de la primera. Si se mantiene estable, el problema está en las otras 4 tarjetas; si sigue fallando, está en la primera línea.

Después se revisan las piezas más frágiles:

  • Los LED de los risers: indican la alimentación de 12 V y de 3,3 V. Los LED azul y rojo deben estar encendidos.
  • Los propios risers: son consumibles y cuestan de 5 a 7 €. Cuando una tarjeta da problemas, no hay que dudar en cambiar su riser.
  • Las conexiones: cada cable y cada conector debe estar bien colocado.

2. Cuando el hardware no tiene la culpa: el overclocking

Una noche pasamos tres horas con un rig nuevo que empezaba a minar y luego se colgaba. Desconectamos una fuente para quedarnos solo con 4 tarjetas: el problema seguía. Cambiamos la placa base y después los risers: siempre el mismo fallo. Las tarjetas gráficas eran nuevas. El hardware no tenía la culpa: el problema venía del overclocking.

Según nuestra experiencia, cuando un rig mina un rato y luego se cuelga, suele deberse a un overclocking demasiado agresivo. En este caso, la causa era la memoria: en una misma GPU, aquí la RTX 3070, la memoria puede ser de marcas distintas. Estábamos acostumbrados a tarjetas no LHR con memoria Samsung, que admite un overclocking de memoria de al menos 2400, e incluso de 2600 a 2700. En los modelos LHR, los fabricantes montan a menudo otra memoria, que consideramos de peor calidad y que se ajusta entre 1400 y 1700, 1800 como máximo. Un ajuste pensado para memoria Samsung hace, por tanto, que estas tarjetas se cuelguen.

3. Vigilar el rig en HiveOS

En la página del worker, varios indicadores ayudan a detectar un problema:

  • Las temperaturas: en las tarjetas NVIDIA, HiveOS solo muestra la temperatura de la GPU, no la de la memoria, aunque a menudo es ella la que provoca los cuelgues. Las tarjetas AMD sí informan de la temperatura de la memoria. Las RTX 3080 y 3090, con GDDR6X, suelen tener problemas de calor en la memoria.
  • Los mensajes: una zona reúne los cambios de configuración, las advertencias y los errores. Conviene consultarla con regularidad.
  • La tabla de tarjetas: temperaturas, velocidad de los ventiladores y consumo de cada GPU.
  • El load average: mide la carga del procesador. En nuestro rig es de 0,28 en el último minuto y de 0,16 de media en los últimos 15 minutos, lo cual es normal. No debe superar el número de núcleos del procesador multiplicado por 2.

Para ir más lejos, el menú Miners, luego Action y Miner log, muestra la salida del software de minería. Ahí se ven los errores que preceden a un cuelgue.

4. Automatizar los reinicios con el watchdog

El watchdog, «el perro que vigila», reinicia automáticamente el minero o el rig cuando se cumple una condición. Por ejemplo, se puede:

  • reiniciar el minero al cabo de tres minutos si detecta un problema;
  • reiniciar el rig tras un número determinado de minutos;
  • reiniciar si el load average supera un umbral;
  • vigilar el hashrate: si T-Rex baja de 250 MH/s, algo va mal y el watchdog reinicia el minero.

Tuvimos un rig que se colgaba cada 5, 10 o 15 horas y durante varias semanas no encontramos la causa. Con el watchdog, el rig volvía a arrancar solo, lo que limitaba el tiempo de minería perdido mientras buscábamos. La causa resultó ser la memoria de las tarjetas tipo RTX 3080, que se calentaba demasiado y hacía caer el minero: un clásico.

5. La línea de comandos para un diagnóstico a fondo

En HiveOS, Remote access y luego Hive Shell Start abre una línea de comandos, como si estuviéramos conectados directamente al rig. Algunos comandos útiles:

  • net-test: comprueba la conexión con los servidores de HiveOS y que no haya problemas de proxy;
  • miner log: muestra la salida del minero, incluido el porcentaje de shares válidos;
  • nvidia-info: enumera las GPU NVIDIA, numeradas a partir de 0;
  • gpu-fans-find seguido del número de la tarjeta: hace girar sus ventiladores para identificarla físicamente en el rig;
  • top: muestra el uso del procesador y de la memoria de cada proceso (Shift + P para ordenar por procesador, Shift + M por memoria).

Por último, vigila los shares: el porcentaje de shares válidos debe mantenerse en torno al 98-99 %. Por debajo, una tarjeta tiene un problema real, de overclocking o de hardware.

¿Y hoy?

Desde que Ethereum pasó a la prueba de participación en septiembre de 2022, ya no se puede minar Ethereum con tarjetas gráficas y los rigs de GPU se han vuelto marginales. El método sigue siendo válido para cualquier máquina de minería: aislar los componentes uno a uno, vigilar las temperaturas y los registros, y automatizar los reinicios mientras se busca la causa.

Para configurar bien HiveOS, consulta nuestro tutorial de HiveOS (worker, overclocking, flight sheet) y encuentra todos nuestros vídeos en la página de tutoriales. ¿Te pasas a los mineros ASIC? Nuestro equipo puede asesorarte: contáctanos.

Artículo anterior
Artículo siguiente

¡Gracias por suscribirte!

¡Este correo ya está registrado!

Comprar el look

Elegir opciones

Editar opción
Back In Stock Notification

Elegir opciones

this is just a warning
Entrar
Cesta de la compra
0 artículos