Files
noroot 808f6fc055 feat(cluster): Logical Replication wird beim Join automatisch eingerichtet
Bisher war der zweite Node nach dem Join zwar im Cluster registriert und
in der UI sichtbar, replizierte aber keine einzige geteilte Tabelle —
dafuer musste jemand manuell `edgeguard-ctl cluster-setup-standby`
ausfuehren. Wer das uebersah, merkte es erst beim Failover: der neue
Primary stand ohne Domains, Backends, Firewall-Regeln und WireGuard-Keys
da. Das ist jetzt Teil des Join-Vorgangs.

Beide Seiten muessen dafuer vorbereitet sein:

1) Primary, beim Erzeugen des Join-Tokens: ein frisch installierter
   Single-Node hat weder Replikations-Rolle noch PUBLICATION noch
   wal_level=logical. Ohne das liefe das spaetere CREATE SUBSCRIPTION in
   ein 404. Der Token wird deshalb erst ausgegeben, nachdem die
   Publisher-Seite steht — inklusive des einmaligen PG-Restarts
   (wal_level ist ein postmaster-Parameter), der bewusst hier passiert,
   solange der Admin danebensteht und noch kein Peer Traffic erwartet.

   WICHTIG dabei: setupReplicationPrimary rotiert bei jedem Lauf das
   Replikations-Passwort (ALTER ROLE … PASSWORD). Auf einem Cluster mit
   bereits angebundenem Subscriber wuerde ein zweiter Token-Klick dessen
   Connection-String ungueltig machen und die Replikation still
   anhalten. Deshalb laeuft die Initialisierung nur, wenn PUBLICATION
   und Secret nicht bereits existieren.

2) Neuer Node, nach erfolgreichem Join: cluster-setup-standby laeuft
   detached (die Initialkopie dauert je nach Datenmenge Minuten), der
   Wizard pollt GET /setup/replication-status und zeigt running/done/
   failed an. Schlaegt es fehl, steht das manuelle Kommando inkl.
   Primary-Host direkt daneben statt nur einer Fehlermeldung.

Beides braucht root (psql als postgres, pg_hba, PG-Restart), die API
laeuft als unprivilegierter edgeguard → Aufruf via sudo mit gepinnten
Regeln. Das einzige variable Argument (Primary-Host) wird vorher gegen
Hostname/IP-Syntax geprueft; der Aufruf laeuft ohne Shell. Test dafuer
liegt bei.

Ausserdem zwei Doku-Korrekturen: architecture.md behauptete,
cluster-join richte die Replikation gleich mit ein (tut es nicht,
clusterjoin.Join macht nur Cert + Registrierung), und der Hinweistext
von cluster-join verwies noch auf "PG-Basebackup + KeyDB, Phase 3.5" —
beides laut Doku laengst verworfen.

Co-Authored-By: Claude Opus 5 <noreply@anthropic.com>
2026-09-11 11:40:44 +02:00

279 lines
8.4 KiB
Go

package handlers
import (
"context"
"fmt"
"log/slog"
"net"
"strings"
"time"
"github.com/gin-gonic/gin"
"git.netcell-it.de/projekte/edgeguard-native/internal/cluster"
"git.netcell-it.de/projekte/edgeguard-native/internal/handlers/response"
"git.netcell-it.de/projekte/edgeguard-native/internal/models"
"git.netcell-it.de/projekte/edgeguard-native/internal/services/audit"
"git.netcell-it.de/projekte/edgeguard-native/internal/services/clusterjoin"
"git.netcell-it.de/projekte/edgeguard-native/internal/services/setup"
)
// SetupHandler exposes the first-run wizard endpoints. Both endpoints
// are mounted before SetupGate so they remain reachable while the API
// is in setup mode.
type SetupHandler struct {
Store *setup.Store
Audit *audit.Repo
NodeID string
Version string
ClusterStore *cluster.Store
PeerReloader PeerReloader
}
func NewSetupHandler(store *setup.Store) *SetupHandler {
return &SetupHandler{Store: store}
}
// WithAudit injiziert Audit-Repo + Node-ID damit Mutationen (contact-emails)
// in audit_log landen. Optional — wenn Audit nil bleibt, läuft die
// Mutation, aber ohne Log-Eintrag.
func (h *SetupHandler) WithAudit(a *audit.Repo, nodeID string) *SetupHandler {
h.Audit = a
h.NodeID = nodeID
return h
}
// WithVersion macht die laufende Version für auto-register verfügbar.
func (h *SetupHandler) WithVersion(v string) *SetupHandler {
h.Version = v
return h
}
// WithClusterSupport erlaubt dem JoinCluster-Handler nach dem Join den
// Primary in der lokalen ha_nodes zu registrieren + nftables neu zu laden,
// damit Port 8443 bidirektional offen ist.
func (h *SetupHandler) WithClusterSupport(store *cluster.Store, reloader PeerReloader) *SetupHandler {
h.ClusterStore = store
h.PeerReloader = reloader
return h
}
func (h *SetupHandler) Register(rg *gin.RouterGroup) {
g := rg.Group("/setup")
g.GET("/status", h.Status)
g.POST("/complete", h.Complete)
g.POST("/complete-node", h.CompleteAsNode)
g.POST("/join-cluster", h.JoinCluster)
g.GET("/replication-status", h.ReplicationStatus)
}
// RegisterAuthed mountet die Endpoints die nach abgeschlossenem Setup
// den Admin-Modus brauchen — Aufrufer hat requireAuth schon dran.
func (h *SetupHandler) RegisterAuthed(rg *gin.RouterGroup) {
g := rg.Group("/setup")
g.POST("/contact-emails", h.SetContactEmails)
}
// Status returns just the public bits of the setup state: whether
// it's done and (if so) the configured admin_email + acme_email +
// fqdn. Never exposes the password hash.
func (h *SetupHandler) Status(c *gin.Context) {
st, err := h.Store.Load()
if err != nil {
response.Internal(c, err)
return
}
response.OK(c, gin.H{
"completed": st.Completed,
"admin_email": st.AdminEmail,
"acme_email": st.ACMEEmail,
"fqdn": st.FQDN,
})
}
// SetContactEmails: Admin-only Update der zwei E-Mail-Felder.
// Sessions bleiben aktiv (Cookie referenziert den alten Actor); auf
// nächstem Login zählt der neue Wert.
func (h *SetupHandler) SetContactEmails(c *gin.Context) {
var req struct {
AdminEmail string `json:"admin_email" binding:"required,email"`
ACMEEmail string `json:"acme_email" binding:"required,email"`
}
if err := c.ShouldBindJSON(&req); err != nil {
response.BadRequest(c, err)
return
}
if err := h.Store.SetContactEmails(req.AdminEmail, req.ACMEEmail); err != nil {
response.BadRequest(c, err)
return
}
st, err := h.Store.Load()
if err != nil {
response.Internal(c, err)
return
}
if h.Audit != nil {
_ = h.Audit.Log(c.Request.Context(), actorOf(c), "setup.contact_emails",
st.AdminEmail, gin.H{
"admin_email": st.AdminEmail,
"acme_email": st.ACMEEmail,
}, h.NodeID)
}
response.OK(c, gin.H{
"admin_email": st.AdminEmail,
"acme_email": st.ACMEEmail,
})
}
func (h *SetupHandler) Complete(c *gin.Context) {
var req setup.Request
if err := c.ShouldBindJSON(&req); err != nil {
response.BadRequest(c, err)
return
}
st, err := h.Store.Complete(req)
if err != nil {
response.BadRequest(c, err)
return
}
response.OK(c, gin.H{
"completed": st.Completed,
"admin_email": st.AdminEmail,
"fqdn": st.FQDN,
})
}
func (h *SetupHandler) CompleteAsNode(c *gin.Context) {
var req setup.NodeRequest
if err := c.ShouldBindJSON(&req); err != nil {
response.BadRequest(c, err)
return
}
st, err := h.Store.CompleteAsNode(req)
if err != nil {
response.BadRequest(c, err)
return
}
response.OK(c, gin.H{
"completed": st.Completed,
"is_cluster_node": st.IsClusterNode,
"fqdn": st.FQDN,
})
}
// JoinCluster performs the full cluster-join flow from the setup wizard:
// fetches certs from the primary, writes them to disk, then marks setup
// as completed. No CLI required.
func (h *SetupHandler) JoinCluster(c *gin.Context) {
var body struct {
FQDN string `json:"fqdn" binding:"required"`
ACMEEmail string `json:"acme_email" binding:"required,email"`
PrimaryFQDN string `json:"primary_fqdn" binding:"required"`
Token string `json:"token" binding:"required"`
}
if err := c.ShouldBindJSON(&body); err != nil {
response.BadRequest(c, err)
return
}
fqdn := strings.ToLower(strings.TrimSpace(body.FQDN))
if err := clusterjoin.Join(clusterjoin.Request{
PrimaryFQDN: body.PrimaryFQDN,
Token: strings.TrimSpace(body.Token),
CommonName: fqdn,
Insecure: true, // security comes from the HMAC token, not TLS cert trust
Force: true, // bootstrap self-signed cert must be replaced
Version: h.Version,
NodeID: h.NodeID,
}); err != nil {
response.BadRequest(c, err)
return
}
st, err := h.Store.CompleteAsNode(setup.NodeRequest{
FQDN: fqdn,
ACMEEmail: body.ACMEEmail,
PrimaryFQDN: strings.ToLower(strings.TrimSpace(body.PrimaryFQDN)),
})
if err != nil {
response.Internal(c, err)
return
}
// Pre-register the primary in our local ha_nodes so its IP lands in
// @peer_ipv4 and port 8443 is open bidirectionally.
if h.ClusterStore != nil && h.PeerReloader != nil {
go h.preRegisterPrimary(body.PrimaryFQDN)
}
// Logical Replication automatisch einrichten. Ohne diesen Schritt waere
// der Node zwar im Cluster registriert, wuerde aber keinerlei geteilte
// Config (Domains, Backends, Firewall-Rules, WireGuard, …) bekommen —
// was frueher erst beim Failover auffiel. Laeuft detached, der Wizard
// pollt /setup/replication-status.
h.startReplicationSetup(body.PrimaryFQDN)
response.OK(c, gin.H{
"completed": st.Completed,
"is_cluster_node": st.IsClusterNode,
"fqdn": st.FQDN,
})
}
// StartupPeerSync is called once after the DB pool and ClusterStore are
// ready. On cluster nodes it re-registers the primary in the local ha_nodes
// and reloads nftables so @peer_ipv4 is correct after a package update or
// reboot — without requiring a new join.
func (h *SetupHandler) StartupPeerSync() {
if h.ClusterStore == nil || h.PeerReloader == nil {
return
}
st, err := h.Store.Load()
if err != nil || st == nil || !st.IsClusterNode || st.PrimaryFQDN == "" {
return
}
h.preRegisterPrimary(st.PrimaryFQDN)
}
// preRegisterPrimary inserts the primary node into the local ha_nodes with
// its resolved IP so nftables @peer_ipv4 allows port 8443 from the primary.
// Uses a stable ID derived from the FQDN so repeated calls are idempotent.
func (h *SetupHandler) preRegisterPrimary(primaryFQDN string) {
ctx, cancel := context.WithTimeout(context.Background(), 15*time.Second)
defer cancel()
primaryFQDN = strings.ToLower(strings.TrimSpace(primaryFQDN))
addrs, err := net.DefaultResolver.LookupHost(ctx, primaryFQDN)
if err != nil || len(addrs) == 0 {
slog.Warn("setup: could not resolve primary FQDN for pre-registration",
"fqdn", primaryFQDN, "error", err)
return
}
ip := addrs[0]
// Stable ID so repeated calls (join + startup) don't accumulate rows.
nodeID := fmt.Sprintf("prenode-%s", strings.ReplaceAll(primaryFQDN, ".", "-"))
n := models.HANode{
ID: nodeID,
Name: primaryFQDN,
FQDN: primaryFQDN,
APIURL: "https://" + primaryFQDN + ":3443",
Role: "primary",
Status: "online",
}
n.PublicIP = &ip
if _, err := h.ClusterStore.UpsertSelf(ctx, n); err != nil {
slog.Warn("setup: pre-register primary in ha_nodes failed", "fqdn", primaryFQDN, "error", err)
return
}
if err := h.PeerReloader(ctx); err != nil {
slog.Warn("setup: PeerReloader failed after primary pre-register", "error", err)
return
}
slog.Info("setup: primary pre-registered locally, firewall updated",
"fqdn", primaryFQDN, "ip", ip)
}