Sie arbeiten im Betriebsteam eines Zahlungsswitches, der zwischen Händlern und Kartenherausgebern (Issuern) sitzt. Jede Minute kommen etwa 400 Transaktionen pro Sekunde an; jede wird auf Betrug bewertet, wartet auf einen freien Verbindungsplatz und wird zur Antwort an ihren Issuer weitergeleitet. Das Modell berechnet Warteschlangen, Timeouts, Wiederholungen der Clients, den Zielkonflikt der Betrugsprüfung und das Stand-in-Risiko aus Lehrbuchformeln. Beträge sind in allgemeinen Währungseinheiten (u) angegeben. Nur eine Lernsimulation – keine Finanz-, Rechts- oder Anlageberatung.
Das lernen Sie
Warum Wiederholungen einen überlasteten Switch selbst dann in einem Retry-Sturm festhalten können, wenn Kapazität hinzugefügt wird – und wie der Lastabwurf die Schleife durchbricht.
Wie ein Schwellenwert für den Betrugs-Score Betrugsverluste gegen abgelehnte gute Kunden abwägt und warum der richtige Schwellenwert von der Basisrate des Betrugs abhängt.
Wie ein einziger langsamer Issuer jeden Verbindungsplatz füllt (Little’sches Gesetz) und was Timeouts und Stand-in-Verarbeitung kosten.
Simulator
Zeit 0 min
▶Server in Betrieb
⚙Server startet
·Freier Server-Rackplatz
✓Issuer antwortet normal
⌛Issuer langsam oder ausgefallen
⇄Stand-in-Verarbeitung ein
•Eingehende Transaktionen
Regler
Jeder Server hat 32 Verbindungsplätze. Zusätzliche Server brauchen 5 Minuten zum Start; jeder Server wird berechnet, ob er startet oder nicht.
Lässt höchstens 90 % der Kapazität zu und beantwortet den Überschuss sofort mit „später erneut versuchen“, statt ihn in die Warteschlange zu stellen und in den Timeout laufen zu lassen.
Wie Händler einen technischen Fehler wiederholen (bis zu 3 Wiederholungen). Sofort = in der nächsten Minute; Backoff = zufallsgestütztes exponentielles Backoff, mittlere Verzögerungen 1, 2 und 4 Minuten.
Transaktionen mit einem Score auf oder über diesem Wert werden abgelehnt. Die Scores sind in Standardabweichungen des echten Verkehrs angegeben: niedriger heißt mehr gestoppter Betrug und mehr abgelehnte gute Kunden.
Scores, die so weit unter dem Schwellenwert liegen, erhalten eine zusätzliche Kundenabfrage statt einer Entscheidung: 85 % der echten Kunden schließen sie ab, 5 % der Betrüger bestehen sie. 0 = aus.
Wie lange ein Verbindungsplatz auf die Antwort des Issuers (Kartenherausgebers) wartet. Danach sendet der Switch eine Stornierung (Reversal) und nutzt Stand-in oder lehnt mit „Issuer nicht erreichbar“ ab.
Antwortet der Issuer nicht rechtzeitig, genehmigt der Switch in seinem Namen bis zu diesem Betrag. Jede Stand-in-Genehmigung ist ein Risiko, das der Issuer nie geprüft hat. 0 = aus.
Kennzahlen
Genehmigungsrate guter Kunden
99,9%
normal
Autorisierungszeit
330ms
normal
Betrugsrate (Anteil am genehmigten Betrag)
10,4bp
normal
Belegte Verbindungsplätze
69%
normal
Genehmigungsrate, gesunde Issuer
99,9 %
Von der Betrugsregel abgelehnte gute Kunden
1,3 ‰
An Step-up gesendete Transaktionen
0,0 %
Gestoppter Betrug
31 %
Neue Transaktionen
400 tx/s
Angebotene Last (neu + Wiederholungen)
400 tx/s
Wiederholungen
0 tx/s
Abgeworfen (beantwortet mit „später versuchen“)
0 tx/s
In der Warteschlange verworfen
0,0 %
Issuer-Timeouts
0,0 %
Stand-in-Genehmigungen
0 tx/s
Server in Betrieb
6
Server startet
0
Serverkostenrate
36 u/h
Serverkosten bisher
0 u
Stand-in-Risiko
0,00 M u
Bisher genehmigter Betrug
0,00 M u
Bisher verlorene gute Transaktionen
0,0 k tx
Transaktionen, die auf eine Wiederholung warten
0 tx
Latenz Issuer-Gruppe B (Mittel)
250 ms
Verlauf
Krisenszenarien
Stufe 1 · Ansturm beim Spitzenverkauf
Ein großer Online-Verkauf beginnt in Minute 5 und verdoppelt den Verkehr 45 Minuten lang auf etwa 800 Transaktionen pro Sekunde. Der Switch läuft mit 6 Servern, ausgelegt für einen normalen Tag bei etwa 70 % Auslastung. Händler wiederholen jeden technischen Fehler sofort. Halten Sie gute Kunden genehmigt und die Antworten schnell, ohne Kapazität zu kaufen, die Sie nicht brauchen.
Mittlere Genehmigung guter Kunden ≥ 95 % ab dem Verkauf
Mittlere Autorisierungszeit ≤ 500 ms
Serverkosten ≤ 75 u
Stufe 2 · Betrugswelle
In Minute 5 beginnt die Nutzung eines Stapels gestohlener Kartendaten: Der Betrugsanteil am Verkehr springt von 0,1 % auf 1 %. Die Ablehnungsschwelle ist für normale Tage eingestellt (3σ), und Step-up ist aus. Senken Sie die Betrugsrate, ohne gute Kunden abzuweisen.
Mittlere Betrugsrate ≤ 25 bp
Mittlere Genehmigung guter Kunden ≥ 98 %
Von der Regel abgelehnte gute Kunden ≤ 5 ‰
Stufe 3 · Ausfall eines Issuers
In Minute 5 werden die Issuer der Gruppe B – ein Viertel des gesamten Verkehrs – auf eine mittlere Antwortzeit von 12 Sekunden langsam. Der Switch wartet bis zu 8 s auf eine Antwort, hat kein Stand-in und läuft mit 6 Servern. Halten Sie die Kunden der gesunden Issuer im Fluss, bedienen Sie Gruppe B, soweit Sie es sicher können, und halten Sie Stand-in-Risiko und Kosten im Rahmen.
Mittlere Genehmigung für Kunden gesunder Issuer ≥ 90 %
Mittlere Genehmigung guter Kunden ≥ 86 %
Stand-in-Risiko ≤ 9 M u
Serverkosten ≤ 65 u
Grundlage — das Modell hinter den Zahlen
Jede Beziehung, die der Simulator verwendet, mit ihrer Quelle. Als Annahmen gekennzeichnete Konstanten sind anschauliche Kalibrierungen.
Neue Transaktionen kommen mit einer Grundrate mal dem Verkaufsansturm an; die Anzahl pro Minute ist zufällig (Poisson, Normalnäherung) mit etwas Burstiness.
λ(t) = base × surge(t) (2-min lag); count/min ≈ N(60λ, √(60λ)) × (1 + N(0, 0.03))[2]Annahme: Platzzahlen, Bedien- und Issuer-Zeiten, Score-Trennung, Step-up-Erfolgsraten, Anteil vergeudeter Arbeit, Beträge und Preise sind Beispielwerte für einen mittelgroßen Switch, keine Zahlen irgendeines realen Netzes.
Binormaler Betrugs-Score: Die Scores echter und betrügerischer Transaktionen sind zwei Normalverteilungen im Abstand d′; der Schwellenwert wählt einen Punkt auf der ROC-Kurve.
genuine score ~ N(0,1), fraud ~ N(d′,1), d′ = 2.5; FPR(t) = 1 − Φ(t), TPR(t) = 1 − Φ(t − d′); AUC = Φ(d′/√2) ≈ 0.96[6][7]Annahme: Platzzahlen, Bedien- und Issuer-Zeiten, Score-Trennung, Step-up-Erfolgsraten, Anteil vergeudeter Arbeit, Beträge und Preise sind Beispielwerte für einen mittelgroßen Switch, keine Zahlen irgendeines realen Netzes.
Kostenoptimaler Schwellenwert: ablehnen, wenn das Likelihood-Verhältnis das mit der Basisrate gewichtete Kostenverhältnis übersteigt – zehnmal mehr Betrug verschiebt ihn um ln 10 / d′ ≈ 0,9σ nach unten.
Step-up: Scores im Band unterhalb des Schwellenwerts erhalten eine Abfrage, statt entschieden zu werden.
scores in [t − b, t) are challenged: genuine pass 85 %, fraud pass 5 %; scores ≥ t declined[10]Annahme: Platzzahlen, Bedien- und Issuer-Zeiten, Score-Trennung, Step-up-Erfolgsraten, Anteil vergeudeter Arbeit, Beträge und Preise sind Beispielwerte für einen mittelgroßen Switch, keine Zahlen irgendeines realen Netzes.
Die Issuer-Latenz ist exponentialverteilt; ein Platz wird für die Latenz oder den Timeout belegt, je nachdem, was zuerst eintritt.
L ~ Exp(mean m); E[min(L, T)] = m(1 − e^(−T/m)), P(L > T) = e^(−T/m); S = 80 ms + forwarded × Σ share·E[min(L,T)][2][9]
Erlang C: die Wahrscheinlichkeit, dass eine Transaktion auf einen freien Platz wartet, und die Wahrscheinlichkeit, dass sie länger als den 2-s-Warteschlangen-Timeout wartet.
P(W > 2 s) = C(a, N)·e^(−(N/S − λ)·2 s), a = λS; mean wait = C / (N/S − λ)[1][2]
Jenseits der Kapazität verwendet der Switch auch Arbeit auf Anfragen, die er später verwirft, sodass der nutzbare Durchsatz mit steigender Last sinkt; der Lastabwurf weist den Überschuss kostengünstig ab.
λ ≥ N/S: goodput = (N/S − ω·λ)/(1 − ω), ω = 0.3; load shedding admits ≤ 0.9·N/S and answers the rest at once[4][5]Annahme: Platzzahlen, Bedien- und Issuer-Zeiten, Score-Trennung, Step-up-Erfolgsraten, Anteil vergeudeter Arbeit, Beträge und Preise sind Beispielwerte für einen mittelgroßen Switch, keine Zahlen irgendeines realen Netzes.
Wiederholungen der Clients: Jeder technische Fehler wird bis zu dreimal wiederholt, sofort oder mit zufallsgestütztem exponentiellem Backoff.
failed attempt → retry with p = 0.95, ≤ 3 retries; immediate: next minute; backoff: delay ~ Exp(mean 1, 2, 4 min)[4][5]Annahme: Platzzahlen, Bedien- und Issuer-Zeiten, Score-Trennung, Step-up-Erfolgsraten, Anteil vergeudeter Arbeit, Beträge und Preise sind Beispielwerte für einen mittelgroßen Switch, keine Zahlen irgendeines realen Netzes.
Issuer-Timeout, Stornierung und Stand-in: Die Beträge sind lognormalverteilt, sodass der Anteil unter dem Limit und das genehmigte Volumen aus der Normalverteilungsfunktion folgen.
issuer timeout → reversal; stand-in approves if amount ≤ limit: P = Φ((ln L − μ)/σ), volume = e^(μ+σ²/2)·Φ((ln L − μ − σ²)/σ)[9][11]
Betrugsrate in Basispunkten des genehmigten Betrags; 13 bp dienen als Referenzgröße für kleine Fernzahlungen mit Karte.
32 slots per server, 2–24 servers, +5 min boot, 6 u per server-hour · switch time 80 ms · queue timeout 2 s · issuer latency 250 ms (group B = 25 % of traffic, ±15 % per minute) · amounts lognormal, median 40 u, σ = 1, fraud ×1.5 · ω = 0.3 · shedding at 90 % · reversal = 80 ms of switch timeAnnahme: Platzzahlen, Bedien- und Issuer-Zeiten, Score-Trennung, Step-up-Erfolgsraten, Anteil vergeudeter Arbeit, Beträge und Preise sind Beispielwerte für einen mittelgroßen Switch, keine Zahlen irgendeines realen Netzes.
Zufall: ein Mulberry32-Generator mit Seed; verwendete Verteilungen — gleichverteilt, exponentiell (inverse Verteilungsfunktion), normal (Box–Muller), Poisson (Knuth). Der Seed wird angezeigt und lässt sich teilen.
M. Harchol-Balter — Performance Modeling and Design of Computer Systems: Queueing Theory in Action (M/M/k, capacity provisioning) — Cambridge University Press, 2013