サーバーパフォーマンス監視とは、CPU使用率、メモリ消費量、ストレージ容量、I/Oパフォーマンス、ネットワーク稼働率などのシステムリソースを監視するプロセスです。
サーバーの応答時間、リソース使用率、アプリケーションのダウンタイムなど、パフォーマンスに関する問題の特定に役立ちます。さらに、管理者がサーバー上のシステムリソース消費量を把握できるため、容量や効率の計画にも役立ちます。
サーバー監視とは?
パフォーマンス監視では一般に、パフォーマンス指標に照らして、時間の経過に伴うパフォーマンスの指標を測定します。サーバーインフラと周辺ネットワークがますます分散化・複雑化する中、これは特に困難になり得ます。
サーバーパフォーマンス監視を成功させるための主な要素は次のとおりです。
- 主要な指標を特定する
- サーバーパフォーマンスに関する指標のベースラインを設定する
- 主要な指標に基づく付加価値をレポートする
そのため、サーバーパフォーマンス監視では、サーバーの優れたパフォーマンスを確保する主要な指標を追跡します。
続きを読む:2021年版サーバー監視ソフトウェア・ツールのベスト製品
サーバーパフォーマンス監視の指標
サーバーのパフォーマンスが最適か、改善が必要かを特定するのに役立つ有効な指標があります。これらには、1秒あたりのリクエスト数、エラー率、稼働率、スレッド数、平均応答時間、ピーク応答時間などがあります。
1秒あたりのリクエスト数(RPS)
サーバーの主な役割は、リクエストを受信して処理することです。リクエスト数が過剰になり、処理しきれない状態になると、サーバーのパフォーマンスが低下する可能性があります。
RPSは、監視期間中に受信したリクエスト数を算出する指標です。リクエストの処理時に問題が発生すると、RPSはサーバーのパフォーマンス問題を示します。このように、サーバーの負荷を示す指標となります。
続きを読む:2021年版ロードバランサーのベスト製品
エラー率
エラーとは、サーバーのパフォーマンスを損なう望ましくない問題です。通常、サーバーに大きな負荷がかかっているときに発生します。エラー率は、失敗したリクエスト、またはサーバーから応答を受け取れなかったリクエストの割合を算出する指標です。サーバーのパフォーマンス問題を改善する際に対処すべき、最も重要な指標です。
エラー率は、失敗したリクエスト、またはサーバーから応答を受け取れなかったリクエストの割合を算出する指標です。
稼働率
あらゆる運用において最も重大な問題は、サーバーの可用性です。稼働率とは、サーバーが一定期間にわたって重大な中断なく稼働していた時間の割合を指します。稼働率がサーバーの使用時間の99%を下回った場合は、対策が必要です。
参考までに、高可用性サーバーアーキテクチャは、計画的・計画外の停止中でも99.999%の可用性を実現します。これは「ファイブナイン」の信頼性とも呼ばれます。サーバーはエンドユーザーに対して信頼性を保つ必要があるため、稼働率はパフォーマンス問題を示す有効な指標です。
続きを読む:高可用性アーキテクチャを実現する方法
スレッド数
スレッド数のパラメーターは、サーバーが同時に処理できるリクエストの最大数を指定するもので、サーバーパフォーマンスを示す重要な指標となります。アプリケーションがスレッドを生成しすぎると、エラーが増加する可能性があります。
スレッド数が最大しきい値に達すると、空きができるまでリクエストは保留されます。保留時間が長すぎると、ユーザーにタイムアウトエラーが発生します。
平均応答時間(ART)とピーク応答時間(PRT)
ARTは、すべてのリクエストにおけるリクエスト/レスポンスサイクルの合計時間を、リクエスト数で割って算出します。PRTは、監視期間中の最長サイクルを追跡するため、リクエスト/レスポンスサイクルの長さを算出します。ARTとPRTの指標を評価することは、応答時間を正確に把握する最も効果的な方法です。
サーバーパフォーマンス監視のベストプラクティス
サーバーパフォーマンス監視を利用すると、管理者はサーバーのステータスと健全性を詳細に追跡できます。サーバーパフォーマンス監視のベストプラクティスを3つ紹介します。
視覚的な表示を設定する
可視化とは、グラフ、チャート、マップなどのツールを使って情報やデータをグラフィカルに表現することです。データの可視化は一目で理解しやすく、有用な情報を明確に示します。
ネットワーク全体の設計を明確にマッピングし、主要データを分かりやすく視覚化して、サーバーの健全性をレポートすることで、管理者はサーバーパフォーマンスを監視・理解し、最適化に向けた意思決定を行えます。クラウド監視サービスを利用すれば、これを効果的かつ容易に実現できます。
詳細なアラートを設定する
リアルタイムアラートにより、管理者は問題を認識して迅速に解決できます。問題の修正に推奨される手順を示す自動メッセージや監視ツールからの通知など、詳細なアラートは、単純な警報よりも価値があります。
リアルタイムアラートにより、管理者は問題を認識して迅速に解決できます。
サーバー管理者はまず問題の深刻度を確認し、論理的な影響を理解する必要があります。問題がサーバーに重大な影響を及ぼす場合、管理者は解決に向けた次のステップについて効果的な判断を下せます。
サーバーの健全性を定期的に監視する
サーバーの健全性とは、サーバーの中核機能の状態を指します。サーバーの健全性監視は、サーバーやネットワークの障害を特定するうえで重要な役割を果たし、サーバーの運用調整、ハードウェアの交換、パフォーマンスの最適化の判断に役立ちます。物理的なチェックには、CPU使用率、メモリの空き容量、ディスク容量などが含まれます。
サーバーの健全性監視によって、サーバーの問題を予測したり、現在のデータと過去のデータを比較したりする際に役立つデータを取得できます。企業はサーバーの潜在的な障害を特定し、収益に影響が及ぶ前に対処できます。
サーバー監視が重要な理由とは?
サーバーパフォーマンス監視は、リスクの特定とサーバーパフォーマンスの最適化に不可欠です。最終的に、パフォーマンスは企業の評判やユーザーの期待に影響します。サーバーパフォーマンス監視に対応するプロバイダーは数多くあり、そのソフトウェアはサーバー監視に関連するすべてのプロセスを自動化します。
次に読む:DCIMとは?データセンターインフラストラクチャ管理