Protokolle und Daten

Pufferspeicher für Store-and-Forward am Edge-Gateway dimensionieren

Edge-Puffer dimensionieren: Datenrate, Ausfalldauer, Speicher je Datensatz, Abbauzeit, Aufbewahrungsgrenzen und Verhalten bei voller Warteschlange.

Store-and-Forward bewahrt Messwerte auf einem Gateway auf, während die Verbindung zum Zielsystem ausgefallen ist, und sendet sie nach der Wiederherstellung. So wird aus einem Ausfall eine Verzögerung statt eines Datenverlusts, jedoch nur bis zur Kapazitätsgrenze des Speichers. Dimensionieren Sie den Puffer nach Datenrate und längster zu überbrückender Unterbrechung. Prüfen Sie anschließend die Dauer der nachträglichen Übertragung.

Dieser Leitfaden gehört zur Reihe über Datenqualität und Datenübertragung.

Welcher Speicher schützt die Daten?

Ein Gateway kann Daten an mehreren Stellen vorhalten. Diese Speicher schützen vor unterschiedlichen Ausfällen:

SpeicherÜbersteht einen Ausfall der Verbindung zum ZielÜbersteht einen Neustart des Gateways
Noch nicht gesendeter Stapel im ArbeitsspeicherNur für kurze ZeitNein
Lokale VerlaufsdatenbankJa; Daten sind vor Ort einsehbarJa
Dauerhafte Warteschlange auf DatenträgerJa; Daten werden nach Wiederherstellung gesendetJa

Nur eine dauerhafte Warteschlange auf Datenträger oder ein Prozess, der aus dem lokalen Verlauf sendet, bewahrt die Daten auch über einen langen Ausfall und einen Neustart hinweg. Ein Stapel im Arbeitsspeicher geht verloren, wenn vor der Übertragung der Strom ausfällt. Fragen Sie nach, welchen Speicher das Gateway nutzt und wann Daten von einem Speicher in den nächsten wechseln.

Puffergröße berechnen

Ein Beispiel: An einem Standort entstehen 1.200 Messwerte pro Minute. Das System soll einen Ausfall von 12 Stunden überstehen. Nehmen wir 200 Byte je gespeichertem Datensatz an. Den tatsächlichen Wert einschließlich Indexen und Verwaltungsaufwand müssen Sie am Gateway messen.

GrößeRechnungErgebnis
Eingangsrate1.200 ÷ 6020 Datensätze pro Sekunde
Dauer des Ausfalls12 × 3.60043.200 Sekunden
Zu speichernde Datensätze20 × 43.200864.000 Datensätze
Speicherbedarf864.000 × 200 Byte172,8 MB vor zusätzlichem Verwaltungsaufwand

Planen Sie eine Reserve für Verwaltungsaufwand und längere als erwartete Ausfälle ein. Prüfen Sie, ob andere Daten wie Protokolldateien denselben Speicher füllen können.

Abbauzeit des Rückstands prüfen

Die Wiederherstellung erfolgt nicht sofort. Das Ziel nimmt nur eine begrenzte Anzahl Datensätze pro Sekunde an, während neue Messwerte weiter eintreffen. Der Rückstand sinkt mit der Netto-Abbaurate: Uploadrate abzüglich Eingangsrate.

GrößeRechnungErgebnis
Vom Ziel akzeptierte UploadrateGemessen80 Datensätze pro Sekunde
Neue MesswerteWie oben20 Datensätze pro Sekunde
Netto-Abbaurate80 − 2060 Datensätze pro Sekunde
Zeit bis zum Abbau des Rückstands864.000 ÷ 6014.400 Sekunden oder 4 Stunden

Während dieser vier Stunden zeigt das Zielsystem teilweise Daten, die mehrere Stunden alt sind. Dashboards und Alarme müssen für jeden Wert dessen Messzeit und nicht die Ankunftszeit verwenden. Der Leitfaden zu Zeitstempeln erläutert den Grund.

Zeitgrenzen zusätzlich zur Speicherkapazität

Manche Speicher löschen Daten nach einer bestimmten Zeit, unabhängig von der belegten Kapazität. Manche Zielsysteme lehnen zu alte Daten ab oder nehmen sie an, ohne Summen und Alarme neu zu berechnen. Prüfen Sie beides:

  • die Aufbewahrungsdauer des Gatewayspeichers;
  • das höchste Alter eines vom Ziel akzeptierten Messwerts und dessen Verarbeitung.

Wenn der Puffer voll ist

Legen Sie das Verhalten vor einem Ausfall fest:

RegelFolgeGeeignet für
Älteste Datensätze verwerfenNeuere Daten bleiben erhalten; der Beginn des Ausfalls geht verlorenLaufender Betrieb
Neueste Datensätze verwerfenDer frühere Verlauf bleibt vollständig; das Ende geht verlorenAbrechnung und Audit-Trails, mit Alarm
Erfassung stoppenBestehende Daten werden nicht überschrieben; neue gehen verlorenSelten eine gute Wahl

Lösen Sie rechtzeitig vor dem vollen Puffer einen Alarm aus, zum Beispiel bei 50 % und 80 %, damit jemand eingreifen kann.

Duplikate bei der Wiederherstellung

Ein Gateway kann einen Stapel senden, die Verbindung verlieren, bevor es die Empfangsbestätigung speichert, und den Stapel nach Wiederherstellung erneut senden. Das Ziel erhält dann einige Datensätze doppelt. Vergeben Sie für jeden Datensatz eine Kennung, etwa aus Datenpunkt-ID und Messzeit, damit das Ziel nur eine Kopie behält. Der Leitfaden zu MQTT QoS erklärt die Zustellung mindestens einmal.

Den vollständigen Ausfall prüfen

  1. Unterbrechen Sie die Verbindung zum Ziel für die geplante Ausfalldauer oder führen Sie einen verkürzten Test mit bekannter Datensatzanzahl durch.
  2. Beobachten Sie das Wachstum der Warteschlange und prüfen Sie die Alarme.
  3. Stellen Sie die Verbindung wieder her und messen Sie die Abbauzeit.
  4. Zählen Sie beim Ziel die Datensätze für den Ausfallzeitraum und prüfen Sie Lücken, Duplikate und Zeitstempel.
  5. Wiederholen Sie den Test mit einem Gateway-Neustart während des Ausfalls.

Store-and-Forward mit Edge

Edge auf dem ZGW-20 Gateway hält einen lokalen Verlauf aller Messwerte für Dashboards und Analysen vor Ort. Fällt ein Zielsystem aus, legt Edge noch nicht übertragene Daten in einer Warteschlange auf Datenträger ab, prüft das Ziel jede Minute und überträgt die Daten nach Wiederherstellung mit ihren ursprünglichen Zeitstempeln. Ein Stapel, der beim Ausfall noch im Arbeitsspeicher liegt, kann verloren gehen. Eine erneute Übertragung kann einen Stapel doppelt zustellen. Führen Sie deshalb die beschriebenen Tests für Duplikate und Ausfälle an jedem Zielsystem durch.

Häufige Fragen

Was bedeutet Store-and-Forward?

Ein Gateway speichert Daten vor Ort, solange die Verbindung zum Ziel ausgefallen ist, und überträgt sie nach deren Wiederherstellung. Bis zur Kapazitätsgrenze des Speichers wird aus einem Netzwerkausfall eine Verzögerung statt eines Datenverlusts.

Wie groß muss ein Store-and-Forward-Puffer sein?

Multiplizieren Sie Datensätze pro Sekunde mit der längsten Ausfalldauer in Sekunden und dem Speicherbedarf je Datensatz. Rechnen Sie eine Reserve hinzu. Bei 1.200 Messwerten pro Minute, 12 Stunden Ausfall und 200 Byte je Datensatz sind das 864.000 Datensätze und etwa 173 MB vor zusätzlichem Verwaltungsaufwand.

Wie lange dauert das Leeren des Puffers nach einem Ausfall?

Teilen Sie den Rückstand durch die Netto-Abbaurate: Uploadrate minus Rate neuer Messwerte. Bei 864.000 aufgelaufenen Datensätzen, 80 übertragenen und 20 neuen Datensätzen pro Sekunde dauert es vier Stunden.