Set-OPS-Public/roles/client_unbound
Daniel Allaire 0de5294a20 client_unbound : survivre a la perte de connexion sans la masquer
Le deploiement s'interrompait autour du redemarrage d'Unbound (« banner
exchange »), et Ansible abandonnait alors TOUTES les couches suivantes de
l'hote — alors qu'il repondait de nouveau une minute plus tard.

Ma premiere explication etait fausse et je l'ai verifiee avant de coder :
sshd -T dit usedns no, il n'y a pas de resolution inverse. Et la cause reste
INCONNUE — j'avais ecrase le journal du deploiement rate en relancant. Faute
de methode, pas de raisonnement.

Ce que le depot sait de ce symptome est deja dans le Makefile : a travers la
frontiere le TCP s'etablit par proxy SYN, et l'echec se lit « banner exchange »
meme quand l'hote n'est pas la. Le message accuse SSH pour un probleme
d'accessibilite.

Corrige sans pretendre connaitre la cause : ignore_unreachable sur le handler,
puis wait_for_connection qui EXIGE le retour (180 s). Si l'hote ne revient
pas, la tache suivante echoue franchement — on ne masque rien.

Regle pour moi : ne plus ecraser le journal d'un echec avant de l'avoir lu.

Co-Authored-By: Claude Opus 5 <noreply@anthropic.com>
2026-08-09 11:55:41 -04:00
..
defaults client_unbound : survivre a la perte de connexion sans la masquer 2026-08-09 11:55:41 -04:00
handlers client_unbound : survivre a la perte de connexion sans la masquer 2026-08-09 11:55:41 -04:00
meta dns : client_unbound universel, et un resolveur d'amorcage 2026-08-06 21:41:58 -04:00
tasks client_unbound : survivre a la perte de connexion sans la masquer 2026-08-09 11:55:41 -04:00
templates client_unbound : résolveur local (DNS dynamique) — éprouvé sur un nœud 2026-07-03 14:35:00 -04:00
README.md docs : un README par rôle (12 manquants) + carte remise à l'état du code 2026-07-29 11:32:06 -04:00

client_unbound

Résolveur local par nœud (Unbound) : cache + récursion, avec une stub-zone vers l'autoritatif interne (PowerDNS). Rend la résolution dynamique sans casser Internet. Troisième et dernière couche du DNS interne (docs/dns-interne.md).

Les trois couches

  1. hosts_statiques — plancher /etc/hosts, toujours là, indépendant de tout service ;
  2. serveur_powerdns — autoritatif de la zone interne ;
  3. ce rôle — résolveur local, opt-in, qui rend la résolution dynamique par nœud.

Rôle

  • Installe unbound et bind9-dnsutils (dig, pour valider avant de basculer).
  • Déploie setops.conf : écoute sur 127.0.0.1, stub-zone vers l'autoritatif interne, récursion (ou transitaires) pour le reste d'Internet.
  • Valide la configuration (unbound-checkconf), active le service.
  • Bascule /etc/resolv.conf vers 127.0.0.1 — protégée (voir ci-dessous).

Garde-fou de bascule (anti-coupure)

Changer le résolveur d'un nœud à distance, c'est risquer de le rendre muet. Le rôle exige donc deux interrupteurs, et vérifie avant d'agir :

client_unbound_apply: true
client_unbound_confirm: true

Sans les deux, le rôle installe et démarre Unbound mais ne touche pas à /etc/resolv.conf (refus explicite). Avec les deux, il applique d'abord les redémarrages en attente, puis valide qu'Unbound résout réellement (un nom interne et un nom Internet) — et ne bascule qu'ensuite. Même doctrine que la règle 4 d'AGENTS.md : action risquée = confirmation explicite.

Variables

Variable Défaut Rôle
client_unbound_ecoute 127.0.0.1 Écoute (boucle locale)
client_unbound_zone_interne {{ domaine_interne }} Zone en stub
client_unbound_dns_autoritatif dérivé du groupe serveur_powerdns Cible de la stub-zone
client_unbound_transitaires [] Vide = récursion propre (racine + DNSSEC)
client_unbound_apply / _confirm false / false Bascule de /etc/resolv.conf

Flux (meta/flux.yml)

53/udp entrant en localhost · 53/tcp sortant vers serveur_powerdns.

Notes / limites

  • Transitaires vides = Unbound récurse lui-même (racine + DNSSEC). Si la récursion sortante est bloquée par le réseau, renseigner client_unbound_transitaires.
  • Le rôle exige l'IP de l'autoritatif interne (assertion) : serveur_powerdns doit être dans l'inventaire avec un ansible_host.
  • DoT (DNS chiffré) n'est pas encore branché — c'est un des flux restants du zéro-confiance.

Prérequis

  • serveur_powerdns actif. Couche agents.