feat: HA-Cluster v1.2.x — Split-Brain, TOTP, Enterprise-FW, Drift-Fix, VIP-Recovery
- keepalived: pg_role='standby' hat Vorrang vor role für BACKUP-Bestimmung - keepalived-master.sh: gecrasht Dienste beim MASTER-Übergang starten (nicht nur reload) - confighash: ip_addresses per Interface-Name hashen statt per FK (Cross-Node-Drift-Fix) - TOTP/2FA: RFC 6238 — Setup-Flow, QR-Code, Admin-Disable; two-step Login - Firewall-UI: Enterprise-Design — auto-Beschreibung, icon-only Actions, zero-hit Indikator - fe80-Filter: Link-local IPv6 aus NTP/DNS Listen-Dropdowns entfernen - VIP-Dashboard, Dual-Path VRRP, GW-Tracking (Migrations 0033/0034) - Forward Proxy + DNS erweiterte Einstellungen (Migrations 0031/0032) - unbound-control: edgeguard in unbound-Gruppe via postinst Co-Authored-By: Claude Sonnet 4.6 <noreply@anthropic.com>
This commit is contained in:
@@ -61,7 +61,7 @@ import (
|
||||
usersvc "git.netcell-it.de/projekte/edgeguard-native/internal/services/users"
|
||||
)
|
||||
|
||||
var version = "1.2.13"
|
||||
var version = "1.2.35"
|
||||
|
||||
func main() {
|
||||
addr := os.Getenv("EDGEGUARD_API_ADDR")
|
||||
@@ -186,10 +186,8 @@ func main() {
|
||||
} else {
|
||||
slog.Warn("cluster: cannot normalize primary URL for push", "primary", st.PrimaryFQDN, "error", normErr)
|
||||
}
|
||||
// Logical Replication liefert Änderungen automatisch — aber Service-
|
||||
// Configs (haproxy.cfg, nftables …) müssen nach jeder Änderung neu
|
||||
// gerendert werden. Diese Goroutine erkennt hash-Änderungen und rendert.
|
||||
go runSecondaryConfigRender(context.Background(), pool)
|
||||
// runSecondaryConfigRender wird weiter unten gestartet sobald
|
||||
// clusterAggregator verfügbar ist (braucht mTLS-Client für Cert-Sync).
|
||||
}
|
||||
|
||||
// Phase 3.3: Cluster-CA + Peer-Cert. Founder-Pfad — auf einem
|
||||
@@ -236,6 +234,12 @@ func main() {
|
||||
}
|
||||
}
|
||||
|
||||
// Secondary-Config-Render: jetzt wo der Aggregator bereit ist starten.
|
||||
// Aggregator wird für Cert-Sync (mTLS GET /agent/cluster/tls-certs) benötigt.
|
||||
if nodeID != "" && st != nil && st.IsClusterNode && st.PrimaryFQDN != "" {
|
||||
go runSecondaryConfigRender(context.Background(), pool, secrets.New(""), clusterAggregator, nodeID)
|
||||
}
|
||||
|
||||
auditRepo := audit.New(pool)
|
||||
domainsRepo := domains.New(pool)
|
||||
domainHeadersRepo := domainheaders.New(pool)
|
||||
@@ -706,14 +710,24 @@ func runClusterHeartbeat(ctx context.Context, pool *pgxpoolPool, localID, versio
|
||||
// Service-Configs wenn die Logical Replication Änderungen vom Primary
|
||||
// geliefert hat. Erkennt das an einem geänderten config_hash.
|
||||
// Tick: 5 min — balanciert Reaktionszeit gegen Reload-Overhead.
|
||||
func runSecondaryConfigRender(ctx context.Context, pool *pgxpoolPool) {
|
||||
//
|
||||
// Cert-Sync läuft auf jedem Tick unabhängig vom config_hash, da certbot-
|
||||
// Renewals auf dem Primary den Hash nicht ändern.
|
||||
func runSecondaryConfigRender(ctx context.Context, pool *pgxpoolPool, box *secrets.Box, agg *aggregator.Aggregator, localID string) {
|
||||
const tick = 5 * time.Minute
|
||||
t := time.NewTicker(tick)
|
||||
defer t.Stop()
|
||||
var lastHash string
|
||||
render := func() {
|
||||
rCtx, cancel := context.WithTimeout(ctx, 60*time.Second)
|
||||
rCtx, cancel := context.WithTimeout(ctx, 90*time.Second)
|
||||
defer cancel()
|
||||
|
||||
// TLS-Zertifikate bei jedem Tick synchronisieren — unabhängig vom
|
||||
// config_hash, da certbot-Renewals den Hash nicht berühren.
|
||||
if err := handlers.SyncTLSCertsFromPrimary(rCtx, pool, agg, localID); err != nil {
|
||||
slog.Warn("cluster: cert sync failed", "error", err)
|
||||
}
|
||||
|
||||
hash, err := cluster.ComputeConfigHash(rCtx, pool)
|
||||
if err != nil || hash == lastHash {
|
||||
return
|
||||
@@ -728,10 +742,32 @@ func runSecondaryConfigRender(ctx context.Context, pool *pgxpoolPool) {
|
||||
if err := firewallrender.New(pool).Render(rCtx); err != nil {
|
||||
slog.Warn("cluster: secondary nftables render failed", "error", err)
|
||||
}
|
||||
// Weitere Dienste (Squid, Unbound, Chrony, WireGuard) werden bei
|
||||
// Änderungen an ihren spezifischen Tabellen ebenfalls neu gerendert.
|
||||
// render-config ohne Reload: die Dienste merken Änderungen selbst
|
||||
// (HAProxy/nftables über systemctl reload, der oben bereits läuft).
|
||||
// WireGuard — Interface-Configs + wg-quick@<iface> reload
|
||||
if err := wgrender.New(pool, box).Render(rCtx); err != nil {
|
||||
slog.Warn("cluster: secondary wireguard render failed", "error", err)
|
||||
}
|
||||
// Squid forward proxy
|
||||
if err := squidrender.New(pool).Render(rCtx); err != nil {
|
||||
slog.Warn("cluster: secondary squid render failed", "error", err)
|
||||
}
|
||||
// Unbound DNS
|
||||
if err := unboundrender.New(pool).Render(rCtx); err != nil {
|
||||
slog.Warn("cluster: secondary unbound render failed", "error", err)
|
||||
}
|
||||
// Chrony NTP
|
||||
if err := chronyrender.New(pool).Render(rCtx); err != nil {
|
||||
slog.Warn("cluster: secondary chrony render failed", "error", err)
|
||||
}
|
||||
// Netzwerk-Interfaces (VLAN/Bridge/Bond) — erstellt Interface-Objekte,
|
||||
// weist aber KEINE IPs zu (das ist node-spezifisch und darf nicht aus
|
||||
// der Replikation kommen — sonst IP-Konflikt mit dem Primary).
|
||||
if err := networkifs.NewGenerator(networkifs.New(pool)).Render(rCtx); err != nil {
|
||||
slog.Warn("cluster: secondary interfaces render failed", "error", err)
|
||||
}
|
||||
// IP-Adressen werden auf dem Secondary NICHT aus der Replikation
|
||||
// angewendet. Jeder Node konfiguriert seine eigenen IPs statisch
|
||||
// (z.B. /etc/network/interfaces). Floating-Service-IPs werden von
|
||||
// Keepalived verwaltet — nicht vom Renderer.
|
||||
}
|
||||
// Initialer Check nach kurzem Delay (Replication braucht einen Moment)
|
||||
select {
|
||||
|
||||
@@ -41,7 +41,7 @@ import (
|
||||
"git.netcell-it.de/projekte/edgeguard-native/internal/services/tlscerts"
|
||||
)
|
||||
|
||||
var version = "1.2.15"
|
||||
var version = "1.2.35"
|
||||
|
||||
const (
|
||||
// renewTickInterval — how often we re-evaluate expiring certs.
|
||||
|
||||
Reference in New Issue
Block a user