Die Überwachung der Serverleistung ist der Prozess der Überwachung von Systemressourcen wie CPU-Auslastung, Speicherverbrauch, Speicherkapazität, I/O-Leistung, Netzwerkverfügbarkeit und mehr.
Sie hilft dabei, leistungsbezogene Probleme eines Servers zu erkennen, etwa bei Antwortzeit, Ressourcennutzung und Ausfallzeiten von Anwendungen. Darüber hinaus unterstützt sie die Kapazitäts- und Effizienzplanung, indem sie Administratoren hilft, den Verbrauch von Systemressourcen auf dem Server zu verstehen.
Was ist Server-Monitoring?
Beim Performance-Monitoring werden im Allgemeinen Leistungskennzahlen über einen bestimmten Zeitraum hinweg anhand von Leistungsindikatoren gemessen. Das kann problematisch sein, insbesondere wenn die Serverinfrastruktur und das umgebende Netzwerk zunehmend verteilt und komplex sind.
Zu den wichtigsten Bestandteilen einer erfolgreichen Strategie zur Überwachung der Serverleistung gehören:
- Die wichtigsten Kennzahlen identifizieren
- Die für die Serverleistung relevanten Kennzahlen als Basiswerte festlegen
- Den zusätzlichen Wert der wichtigsten Kennzahlen dokumentieren
Dementsprechend wird die Serverleistung überwacht, indem die wichtigsten Kennzahlen erfasst werden, die eine hervorragende Leistung des Servers sicherstellen.
Weiterlesen: Die beste Server-Monitoring-Software und Tools für 2021
Kennzahlen zur Überwachung der Serverleistung
Einige wirksame Indikatoren helfen dabei festzustellen, ob die Serverleistung optimal ist oder verbessert werden muss. Dazu können Anfragen pro Sekunde, Fehlerraten, Verfügbarkeit, Thread-Anzahl, durchschnittliche Antwortzeit und maximale Antwortzeit gehören.
Anfragen pro Sekunde (RPS)
Eine Hauptaufgabe eines Servers besteht darin, Anfragen zu empfangen und zu verarbeiten. Die Serverleistung kann beeinträchtigt werden, wenn die Anzahl der Anfragen zu hoch und nicht mehr tragbar wird.
RPS ist eine Kennzahl, die die Anzahl der während eines Überwachungszeitraums empfangenen Anfragen berechnet. RPS weist auf ein Serverleistungsproblem hin, wenn bei der Verarbeitung von Anfragen Schwierigkeiten auftreten. Auf diese Weise ist RPS ein Indikator für die Auslastung eines Servers.
Weiterlesen: Die besten Load Balancer für 2021
Fehlerraten
Fehler sind unerwünschte Probleme, die die Serverleistung beeinträchtigen können. Sie treten typischerweise auf, wenn der Server einer hohen Last ausgesetzt ist. Die Fehlerrate ist eine Kennzahl, die den Prozentsatz der Anfragen berechnet, die fehlschlagen oder keine Antwort vom Server erhalten. Dies ist der wichtigste Indikator, der bei der Behebung von Problemen mit der Serverleistung berücksichtigt werden sollte.
Die Fehlerrate ist eine Kennzahl, die den Prozentsatz der Anfragen berechnet, die fehlschlagen oder keine Antwort vom Server erhalten.
Verfügbarkeit
Das kritischste Problem für jeden Betrieb ist die Verfügbarkeit des Servers. Die Verfügbarkeit bezeichnet den Zeitraum, in dem ein Server in einem bestimmten Zeitraum ohne erhebliche Unterbrechung ausgeführt wurde. Wenn die Verfügbarkeitskennzahl unter 99 % der Nutzungszeit eines Servers liegt, besteht Handlungsbedarf.
Zur Einordnung: Eine hochverfügbare Serverarchitektur unterstützt eine Verfügbarkeit von 99,999 %, selbst bei geplanten und ungeplanten Ausfällen – auch als Five-Nines-Zuverlässigkeit bezeichnet. Ein Server sollte für die Endnutzer zuverlässig sein; daher ist die Verfügbarkeit ein guter Indikator für Leistungsprobleme.
Weiterlesen: So erreichen Sie eine hochverfügbare Architektur
Thread-Anzahl
Die Parameter für die Thread-Anzahl legen fest, wie viele Anfragen der Server gleichzeitig verarbeiten kann, und können ein wichtiger Indikator für die Serverleistung sein. Wenn eine Anwendung zu viele Threads erzeugt, kann die Zahl der Fehler steigen.
Sobald die Thread-Anzahl den maximalen Schwellenwert erreicht, werden die Anfragen zurückgehalten, bis wieder Kapazität verfügbar ist. Dauert die Wartezeit zu lange, kommt es bei den Benutzern zu Timeout-Fehlern.
Durchschnittliche Antwortzeit (ART) und maximale Antwortzeit (PRT)
ART berechnet die für alle Anfragen benötigte Gesamtzeit des Anfrage-/Antwortzyklus, geteilt durch die Anzahl der Anfragen. PRT berechnet die Dauer der Anfrage-/Antwortzyklen, um den längsten Zyklus innerhalb eines Überwachungszeitraums zu ermitteln. Die Auswertung der ART- und PRT-Kennzahlen ist die effektivste Methode, um ein präzises Verständnis der Antwortzeit zu erhalten.
Best Practices für die Überwachung der Serverleistung
Die Überwachung der Serverleistung ermöglicht Administratoren, detaillierte Informationen über den Zustand und die Gesundheit eines Servers. Im Folgenden werden drei Best Practices für die Überwachung der Serverleistung vorgestellt.
Eine visuelle Darstellung einrichten
Visualisierungen sind grafische Darstellungen von Informationen und Daten mithilfe von Werkzeugen wie Diagrammen, Grafiken und Karten. Die Datenvisualisierung lässt sich auf einen Blick leichter verstehen und hebt nützliche Informationen hervor.
Eine klare Darstellung des gesamten Netzwerkaufbaus, eine übersichtliche visuelle Darstellung wichtiger Daten und die Berichterstattung über den Serverzustand helfen Administratoren dabei, die Serverleistung zu überwachen, zu verstehen und Entscheidungen zu ihrer Optimierung zu treffen. Dies lässt sich mithilfe von Cloud-Monitoring-Diensten effektiv und problemlos umsetzen.
Detaillierte Warnmeldungen einrichten
Echtzeitwarnungen machen Administratoren auf Probleme aufmerksam und helfen dabei, diese schnell zu beheben. Detaillierte Warnmeldungen, etwa automatisierte Nachrichten oder Benachrichtigungen des Monitoring-Tools mit empfohlenen Vorgehensweisen zur Behebung des jeweiligen Problems, sind wertvoller als einfache Alarme.
Echtzeitwarnungen machen Administratoren auf Probleme aufmerksam und helfen dabei, diese schnell zu beheben.
Serveradministratoren müssen zunächst den Schweregrad des Problems prüfen und seine logischen Auswirkungen verstehen. Wenn das Problem schwerwiegende Auswirkungen auf den Server haben wird, kann der Administrator wirksame Entscheidungen über die nächsten Schritte zu seiner Behebung treffen.
Regelmäßige Überwachung des Serverzustands
Der Serverzustand bezeichnet die Beschaffenheit der Kernfunktionen des Servers. Die Überwachung des Serverzustands spielt eine wichtige Rolle bei der Erkennung von Fehlern im Server und Netzwerk und kann dabei helfen, betriebliche Anpassungen am Server, Hardwareaustausch und Leistungsoptimierungen zu bestimmen. Eine physische Prüfung kann die CPU-Auslastung, den verfügbaren Speicher und die Festplattenkapazität umfassen.
Die Überwachung des Serverzustands liefert Daten, die bei der Vorhersage von Serverproblemen und beim Vergleich aktueller mit historischen Daten hilfreich sein können. Unternehmen können potenzielle Ausfälle des Servers erkennen und beheben, bevor sie sich auf das Geschäftsergebnis auswirken.
Warum ist Server-Monitoring wichtig?
Die Überwachung der Serverleistung ist entscheidend, um Risiken zu erkennen und die Serverleistung zu optimieren. Letztlich beeinflusst die Leistung den Ruf eines Unternehmens und die Erwartungen der Benutzer. Es gibt viele Anbieter, die die Überwachung der Serverleistung unterstützen; die Software hilft dabei, alle mit der Überwachung eines Servers verbundenen Prozesse zu automatisieren.
Weiterlesen: Was ist DCIM? Management der Rechenzentrumsinfrastruktur