Débugger son rig de minage (hardware & software hiveos)
Un rig qui plante, une carte graphique qui disparaît, un mineur qui redémarre sans cesse : ce sont les pannes les plus courantes en minage GPU, et elles peuvent faire perdre des heures. Dans cette vidéo de 2021, nous vous montrons comment en trouver l'origine avec méthode, d'abord côté matériel, puis côté logiciel avec les outils de HiveOS : tableau de bord, journaux du mineur, watchdog et ligne de commande.
1. Côté matériel : isoler le problème
Notre exemple est un rig de 8 RTX 3070 non LHR, alimenté par deux alimentations. Le réflexe à avoir : ne pas tout examiner en même temps, mais réduire le nombre d'éléments en cause. On débranche la seconde alimentation et on fait tourner le rig sur les 4 cartes de la première. S'il reste stable, le problème se trouve du côté des 4 autres cartes ; s'il plante encore, il est sur la première ligne.
Ensuite, on vérifie les éléments les plus fragiles :
- Les LED des risers : elles signalent l'alimentation en 12 V et en 3,3 V. Les LED bleue et rouge doivent être allumées.
- Les risers eux-mêmes : ce sont des consommables, qui valent 5 à 7 €. Quand une carte pose problème, on n'hésite pas à changer son riser.
- Les branchements : chaque câble et chaque connecteur doit être bien en place.
2. Quand le matériel n'y est pour rien : l'overclocking
Une nuit, nous avons passé trois heures sur un rig neuf qui se mettait à miner, puis plantait. Nous avons coupé une alimentation pour ne garder que 4 cartes : le problème continuait. Nous avons changé la carte mère, puis les risers : toujours le même souci. Les cartes graphiques étaient neuves. Le matériel n'y était pour rien : le problème venait de l'overclocking.
Par expérience, quand un rig mine un peu puis plante, c'est souvent un réglage d'overclocking trop agressif. Dans ce cas, la cause était la mémoire : sur un même GPU, ici la RTX 3070, la mémoire embarquée peut être de marques différentes. Nous avions l'habitude de cartes non LHR équipées de mémoire Samsung, qui accepte un overclocking mémoire d'au moins 2400, voire 2600 à 2700. Sur les modèles LHR, les fabricants montent souvent une autre mémoire, que nous jugeons de moins bonne qualité, et qui se règle entre 1400 et 1700, 1800 au maximum. Un réglage prévu pour de la mémoire Samsung fait donc planter ces cartes.
3. Surveiller son rig dans HiveOS
Dans la page du worker, plusieurs indicateurs permettent de repérer un problème :
- Les températures : sur les cartes NVIDIA, HiveOS n'affiche que la température du GPU, pas celle de la mémoire, alors que c'est souvent elle qui fait planter. Les cartes AMD, elles, remontent la température mémoire. Les RTX 3080 et 3090, équipées de GDDR6X, sont souvent problématiques en termes de chauffe mémoire.
- Les messages : une zone regroupe les changements de configuration, les avertissements et les erreurs. Il faut la consulter régulièrement.
- Le tableau des cartes : températures, vitesse des ventilateurs et consommation de chaque GPU.
- Le load average : il mesure la charge du processeur. Sur notre rig, il est de 0,28 sur la dernière minute et de 0,16 en moyenne sur les 15 dernières minutes, ce qui est normal. Il ne doit pas dépasser le nombre de cœurs du processeur multiplié par 2.
Pour aller plus loin, le menu Miners, puis Action et Miner log, affiche la sortie du logiciel de minage. C'est là qu'on voit les erreurs qui précèdent un plantage.
4. Automatiser les redémarrages avec le watchdog
Le watchdog, « le chien qui surveille », relance automatiquement le mineur ou le rig quand une condition est remplie. On peut par exemple :
- redémarrer le mineur au bout de trois minutes s'il détecte un problème ;
- rebooter le rig après un certain nombre de minutes ;
- rebooter si le load average dépasse un seuil ;
- surveiller le hashrate : si T-Rex descend sous 250 MH/s, il y a un souci, et le watchdog relance le mineur.
Nous avons eu un rig qui plantait toutes les 5, 10 ou 15 heures, sans que nous trouvions la cause pendant quelques semaines. Avec le watchdog, le rig repartait tout seul, ce qui limitait le temps de minage perdu pendant la recherche. La cause était finalement la mémoire des cartes de type RTX 3080, qui chauffait trop et faisait planter le mineur : un grand classique.
5. La ligne de commande pour un diagnostic poussé
Dans HiveOS, Remote access puis Hive Shell Start ouvre une ligne de commande, comme si l'on était branché directement sur le rig. Quelques commandes utiles :
- net-test : vérifie la connexion aux serveurs de HiveOS et l'absence de problème de proxy ;
- miner log : affiche la sortie du mineur, dont le pourcentage de shares valides ;
- nvidia-info : liste les GPU NVIDIA, numérotés à partir de 0 ;
- gpu-fans-find suivi du numéro de la carte : fait tourner ses ventilateurs pour identifier physiquement la carte dans le rig ;
- top : affiche l'utilisation du processeur et de la mémoire par chaque processus (Shift + P pour trier par processeur, Shift + M par mémoire).
Enfin, surveillez les shares : le pourcentage de shares valides doit rester de l'ordre de 98 à 99 %. En dessous, une carte a un vrai problème, d'overclocking ou matériel.
Et aujourd'hui ?
Depuis le passage d'Ethereum à la preuve d'enjeu en septembre 2022, on ne mine plus l'Ethereum avec des cartes graphiques, et les rigs GPU sont devenus marginaux. La méthode reste valable pour toute machine de minage : isoler les éléments un par un, surveiller les températures et les journaux, et automatiser les redémarrages pendant qu'on cherche la cause.
Pour bien configurer HiveOS, revoyez notre tutoriel HiveOS (worker, overclocking, flight sheet) et retrouvez toutes nos vidéos sur la page des tutoriels. Vous passez aux mineurs ASIC ? Notre équipe peut vous conseiller : contactez-nous.

