Bisher war der zweite Node nach dem Join zwar im Cluster registriert und in der UI sichtbar, replizierte aber keine einzige geteilte Tabelle — dafuer musste jemand manuell `edgeguard-ctl cluster-setup-standby` ausfuehren. Wer das uebersah, merkte es erst beim Failover: der neue Primary stand ohne Domains, Backends, Firewall-Regeln und WireGuard-Keys da. Das ist jetzt Teil des Join-Vorgangs. Beide Seiten muessen dafuer vorbereitet sein: 1) Primary, beim Erzeugen des Join-Tokens: ein frisch installierter Single-Node hat weder Replikations-Rolle noch PUBLICATION noch wal_level=logical. Ohne das liefe das spaetere CREATE SUBSCRIPTION in ein 404. Der Token wird deshalb erst ausgegeben, nachdem die Publisher-Seite steht — inklusive des einmaligen PG-Restarts (wal_level ist ein postmaster-Parameter), der bewusst hier passiert, solange der Admin danebensteht und noch kein Peer Traffic erwartet. WICHTIG dabei: setupReplicationPrimary rotiert bei jedem Lauf das Replikations-Passwort (ALTER ROLE … PASSWORD). Auf einem Cluster mit bereits angebundenem Subscriber wuerde ein zweiter Token-Klick dessen Connection-String ungueltig machen und die Replikation still anhalten. Deshalb laeuft die Initialisierung nur, wenn PUBLICATION und Secret nicht bereits existieren. 2) Neuer Node, nach erfolgreichem Join: cluster-setup-standby laeuft detached (die Initialkopie dauert je nach Datenmenge Minuten), der Wizard pollt GET /setup/replication-status und zeigt running/done/ failed an. Schlaegt es fehl, steht das manuelle Kommando inkl. Primary-Host direkt daneben statt nur einer Fehlermeldung. Beides braucht root (psql als postgres, pg_hba, PG-Restart), die API laeuft als unprivilegierter edgeguard → Aufruf via sudo mit gepinnten Regeln. Das einzige variable Argument (Primary-Host) wird vorher gegen Hostname/IP-Syntax geprueft; der Aufruf laeuft ohne Shell. Test dafuer liegt bei. Ausserdem zwei Doku-Korrekturen: architecture.md behauptete, cluster-join richte die Replikation gleich mit ein (tut es nicht, clusterjoin.Join macht nur Cert + Registrierung), und der Hinweistext von cluster-join verwies noch auf "PG-Basebackup + KeyDB, Phase 3.5" — beides laut Doku laengst verworfen. Co-Authored-By: Claude Opus 5 <noreply@anthropic.com>
279 lines
8.4 KiB
Go
279 lines
8.4 KiB
Go
package handlers
|
|
|
|
import (
|
|
"context"
|
|
"fmt"
|
|
"log/slog"
|
|
"net"
|
|
"strings"
|
|
"time"
|
|
|
|
"github.com/gin-gonic/gin"
|
|
|
|
"git.netcell-it.de/projekte/edgeguard-native/internal/cluster"
|
|
"git.netcell-it.de/projekte/edgeguard-native/internal/handlers/response"
|
|
"git.netcell-it.de/projekte/edgeguard-native/internal/models"
|
|
"git.netcell-it.de/projekte/edgeguard-native/internal/services/audit"
|
|
"git.netcell-it.de/projekte/edgeguard-native/internal/services/clusterjoin"
|
|
"git.netcell-it.de/projekte/edgeguard-native/internal/services/setup"
|
|
)
|
|
|
|
// SetupHandler exposes the first-run wizard endpoints. Both endpoints
|
|
// are mounted before SetupGate so they remain reachable while the API
|
|
// is in setup mode.
|
|
type SetupHandler struct {
|
|
Store *setup.Store
|
|
Audit *audit.Repo
|
|
NodeID string
|
|
Version string
|
|
ClusterStore *cluster.Store
|
|
PeerReloader PeerReloader
|
|
}
|
|
|
|
func NewSetupHandler(store *setup.Store) *SetupHandler {
|
|
return &SetupHandler{Store: store}
|
|
}
|
|
|
|
// WithAudit injiziert Audit-Repo + Node-ID damit Mutationen (contact-emails)
|
|
// in audit_log landen. Optional — wenn Audit nil bleibt, läuft die
|
|
// Mutation, aber ohne Log-Eintrag.
|
|
func (h *SetupHandler) WithAudit(a *audit.Repo, nodeID string) *SetupHandler {
|
|
h.Audit = a
|
|
h.NodeID = nodeID
|
|
return h
|
|
}
|
|
|
|
// WithVersion macht die laufende Version für auto-register verfügbar.
|
|
func (h *SetupHandler) WithVersion(v string) *SetupHandler {
|
|
h.Version = v
|
|
return h
|
|
}
|
|
|
|
// WithClusterSupport erlaubt dem JoinCluster-Handler nach dem Join den
|
|
// Primary in der lokalen ha_nodes zu registrieren + nftables neu zu laden,
|
|
// damit Port 8443 bidirektional offen ist.
|
|
func (h *SetupHandler) WithClusterSupport(store *cluster.Store, reloader PeerReloader) *SetupHandler {
|
|
h.ClusterStore = store
|
|
h.PeerReloader = reloader
|
|
return h
|
|
}
|
|
|
|
func (h *SetupHandler) Register(rg *gin.RouterGroup) {
|
|
g := rg.Group("/setup")
|
|
g.GET("/status", h.Status)
|
|
g.POST("/complete", h.Complete)
|
|
g.POST("/complete-node", h.CompleteAsNode)
|
|
g.POST("/join-cluster", h.JoinCluster)
|
|
g.GET("/replication-status", h.ReplicationStatus)
|
|
}
|
|
|
|
// RegisterAuthed mountet die Endpoints die nach abgeschlossenem Setup
|
|
// den Admin-Modus brauchen — Aufrufer hat requireAuth schon dran.
|
|
func (h *SetupHandler) RegisterAuthed(rg *gin.RouterGroup) {
|
|
g := rg.Group("/setup")
|
|
g.POST("/contact-emails", h.SetContactEmails)
|
|
}
|
|
|
|
// Status returns just the public bits of the setup state: whether
|
|
// it's done and (if so) the configured admin_email + acme_email +
|
|
// fqdn. Never exposes the password hash.
|
|
func (h *SetupHandler) Status(c *gin.Context) {
|
|
st, err := h.Store.Load()
|
|
if err != nil {
|
|
response.Internal(c, err)
|
|
return
|
|
}
|
|
response.OK(c, gin.H{
|
|
"completed": st.Completed,
|
|
"admin_email": st.AdminEmail,
|
|
"acme_email": st.ACMEEmail,
|
|
"fqdn": st.FQDN,
|
|
})
|
|
}
|
|
|
|
// SetContactEmails: Admin-only Update der zwei E-Mail-Felder.
|
|
// Sessions bleiben aktiv (Cookie referenziert den alten Actor); auf
|
|
// nächstem Login zählt der neue Wert.
|
|
func (h *SetupHandler) SetContactEmails(c *gin.Context) {
|
|
var req struct {
|
|
AdminEmail string `json:"admin_email" binding:"required,email"`
|
|
ACMEEmail string `json:"acme_email" binding:"required,email"`
|
|
}
|
|
if err := c.ShouldBindJSON(&req); err != nil {
|
|
response.BadRequest(c, err)
|
|
return
|
|
}
|
|
if err := h.Store.SetContactEmails(req.AdminEmail, req.ACMEEmail); err != nil {
|
|
response.BadRequest(c, err)
|
|
return
|
|
}
|
|
st, err := h.Store.Load()
|
|
if err != nil {
|
|
response.Internal(c, err)
|
|
return
|
|
}
|
|
if h.Audit != nil {
|
|
_ = h.Audit.Log(c.Request.Context(), actorOf(c), "setup.contact_emails",
|
|
st.AdminEmail, gin.H{
|
|
"admin_email": st.AdminEmail,
|
|
"acme_email": st.ACMEEmail,
|
|
}, h.NodeID)
|
|
}
|
|
response.OK(c, gin.H{
|
|
"admin_email": st.AdminEmail,
|
|
"acme_email": st.ACMEEmail,
|
|
})
|
|
}
|
|
|
|
func (h *SetupHandler) Complete(c *gin.Context) {
|
|
var req setup.Request
|
|
if err := c.ShouldBindJSON(&req); err != nil {
|
|
response.BadRequest(c, err)
|
|
return
|
|
}
|
|
st, err := h.Store.Complete(req)
|
|
if err != nil {
|
|
response.BadRequest(c, err)
|
|
return
|
|
}
|
|
response.OK(c, gin.H{
|
|
"completed": st.Completed,
|
|
"admin_email": st.AdminEmail,
|
|
"fqdn": st.FQDN,
|
|
})
|
|
}
|
|
|
|
func (h *SetupHandler) CompleteAsNode(c *gin.Context) {
|
|
var req setup.NodeRequest
|
|
if err := c.ShouldBindJSON(&req); err != nil {
|
|
response.BadRequest(c, err)
|
|
return
|
|
}
|
|
st, err := h.Store.CompleteAsNode(req)
|
|
if err != nil {
|
|
response.BadRequest(c, err)
|
|
return
|
|
}
|
|
response.OK(c, gin.H{
|
|
"completed": st.Completed,
|
|
"is_cluster_node": st.IsClusterNode,
|
|
"fqdn": st.FQDN,
|
|
})
|
|
}
|
|
|
|
// JoinCluster performs the full cluster-join flow from the setup wizard:
|
|
// fetches certs from the primary, writes them to disk, then marks setup
|
|
// as completed. No CLI required.
|
|
func (h *SetupHandler) JoinCluster(c *gin.Context) {
|
|
var body struct {
|
|
FQDN string `json:"fqdn" binding:"required"`
|
|
ACMEEmail string `json:"acme_email" binding:"required,email"`
|
|
PrimaryFQDN string `json:"primary_fqdn" binding:"required"`
|
|
Token string `json:"token" binding:"required"`
|
|
}
|
|
if err := c.ShouldBindJSON(&body); err != nil {
|
|
response.BadRequest(c, err)
|
|
return
|
|
}
|
|
|
|
fqdn := strings.ToLower(strings.TrimSpace(body.FQDN))
|
|
|
|
if err := clusterjoin.Join(clusterjoin.Request{
|
|
PrimaryFQDN: body.PrimaryFQDN,
|
|
Token: strings.TrimSpace(body.Token),
|
|
CommonName: fqdn,
|
|
Insecure: true, // security comes from the HMAC token, not TLS cert trust
|
|
Force: true, // bootstrap self-signed cert must be replaced
|
|
Version: h.Version,
|
|
NodeID: h.NodeID,
|
|
}); err != nil {
|
|
response.BadRequest(c, err)
|
|
return
|
|
}
|
|
|
|
st, err := h.Store.CompleteAsNode(setup.NodeRequest{
|
|
FQDN: fqdn,
|
|
ACMEEmail: body.ACMEEmail,
|
|
PrimaryFQDN: strings.ToLower(strings.TrimSpace(body.PrimaryFQDN)),
|
|
})
|
|
if err != nil {
|
|
response.Internal(c, err)
|
|
return
|
|
}
|
|
|
|
// Pre-register the primary in our local ha_nodes so its IP lands in
|
|
// @peer_ipv4 and port 8443 is open bidirectionally.
|
|
if h.ClusterStore != nil && h.PeerReloader != nil {
|
|
go h.preRegisterPrimary(body.PrimaryFQDN)
|
|
}
|
|
|
|
// Logical Replication automatisch einrichten. Ohne diesen Schritt waere
|
|
// der Node zwar im Cluster registriert, wuerde aber keinerlei geteilte
|
|
// Config (Domains, Backends, Firewall-Rules, WireGuard, …) bekommen —
|
|
// was frueher erst beim Failover auffiel. Laeuft detached, der Wizard
|
|
// pollt /setup/replication-status.
|
|
h.startReplicationSetup(body.PrimaryFQDN)
|
|
|
|
response.OK(c, gin.H{
|
|
"completed": st.Completed,
|
|
"is_cluster_node": st.IsClusterNode,
|
|
"fqdn": st.FQDN,
|
|
})
|
|
}
|
|
|
|
// StartupPeerSync is called once after the DB pool and ClusterStore are
|
|
// ready. On cluster nodes it re-registers the primary in the local ha_nodes
|
|
// and reloads nftables so @peer_ipv4 is correct after a package update or
|
|
// reboot — without requiring a new join.
|
|
func (h *SetupHandler) StartupPeerSync() {
|
|
if h.ClusterStore == nil || h.PeerReloader == nil {
|
|
return
|
|
}
|
|
st, err := h.Store.Load()
|
|
if err != nil || st == nil || !st.IsClusterNode || st.PrimaryFQDN == "" {
|
|
return
|
|
}
|
|
h.preRegisterPrimary(st.PrimaryFQDN)
|
|
}
|
|
|
|
// preRegisterPrimary inserts the primary node into the local ha_nodes with
|
|
// its resolved IP so nftables @peer_ipv4 allows port 8443 from the primary.
|
|
// Uses a stable ID derived from the FQDN so repeated calls are idempotent.
|
|
func (h *SetupHandler) preRegisterPrimary(primaryFQDN string) {
|
|
ctx, cancel := context.WithTimeout(context.Background(), 15*time.Second)
|
|
defer cancel()
|
|
|
|
primaryFQDN = strings.ToLower(strings.TrimSpace(primaryFQDN))
|
|
|
|
addrs, err := net.DefaultResolver.LookupHost(ctx, primaryFQDN)
|
|
if err != nil || len(addrs) == 0 {
|
|
slog.Warn("setup: could not resolve primary FQDN for pre-registration",
|
|
"fqdn", primaryFQDN, "error", err)
|
|
return
|
|
}
|
|
ip := addrs[0]
|
|
|
|
// Stable ID so repeated calls (join + startup) don't accumulate rows.
|
|
nodeID := fmt.Sprintf("prenode-%s", strings.ReplaceAll(primaryFQDN, ".", "-"))
|
|
n := models.HANode{
|
|
ID: nodeID,
|
|
Name: primaryFQDN,
|
|
FQDN: primaryFQDN,
|
|
APIURL: "https://" + primaryFQDN + ":3443",
|
|
Role: "primary",
|
|
Status: "online",
|
|
}
|
|
n.PublicIP = &ip
|
|
|
|
if _, err := h.ClusterStore.UpsertSelf(ctx, n); err != nil {
|
|
slog.Warn("setup: pre-register primary in ha_nodes failed", "fqdn", primaryFQDN, "error", err)
|
|
return
|
|
}
|
|
if err := h.PeerReloader(ctx); err != nil {
|
|
slog.Warn("setup: PeerReloader failed after primary pre-register", "error", err)
|
|
return
|
|
}
|
|
slog.Info("setup: primary pre-registered locally, firewall updated",
|
|
"fqdn", primaryFQDN, "ip", ip)
|
|
}
|