Observability
-
Beyond the Twelve-Factor App#Software Design #Cloud Native #Security/Authentication #Security/Authorization #API Architecture #Observability The Twelve-Factor Appを現代のクラウドネイティブ環境向けに拡張した方法論。Kevin Hoffmanによって著され、オリジナルの12要因を15要因に拡張している 追加された新要因は API First、Telemetry、Authentication and Authorization の3つ 既存要因にも Kubernetes ConfigMap/Secrets や Infrastructure as Code(IaC)による環境構築など、現代的なベストプラクティスを反映した注釈が加わる https://www.vmware.com/docs/ebook-beyond-the-12-factor-app
-
Datadog Agent#Observability Datadogへホストのログを送信するソフトウェア。 各ホストの環境別にいくつかのインストール手段が用意されている 例としてKubernetesへのインストール方法は以下 Kubernetes に Datadog Agent をインストールする https://docs.datadoghq.com/ja/agent/?tab=Linux
-
入門 監視
-
GitHubが約8時間ダウンした原因が判明、急増する利用量に重要なインフラが自動拡張できず障害が連鎖#Cloud Native #Observability 2026年8月17日に発生した GitHub の7時間47分にわたる障害の原因を伝える記事。コード変更ではなく、過去最高のトラフィックによる容量不足が起点となっている。 Istio のサイドカーが同時処理数の上限に到達。オートスケールが本体サービスしか監視しておらずサイドカーの容量を考慮していなかった 容量不足は HAProxy と内部の認証経路へ波及し、多数のサービスが認証に依存するため github.com や GitHub Actions へ広がるカスケード障害となった VS Code の潜在的なリトライバグで Copilot Token Service へのアクセスが毎秒7,000〜9,000件から毎秒7〜10万件へ急増し、復旧を遅らせた 背景には AI による利用量の急増があり、月間コミット数は2026年4月の14億件から8月に29億件へ倍増している https://gigazine.net/news/20260821-why-github-down/ ブログ
-
RUMReal User Monitoring #Observability 個々のユーザーのアクティビティをリアルタイムで可視化するもの JavaScriptのようなクライアントサイドの技術を用いて、ブラウザやアプリケーションから直接データを収集する
-
オブザーバビリティ・エンジニアリング
-
Sentry#Observability "developer-first application monitoring platform" を標榜する商用 SaaS。エラー追跡を起点に、エラー監視・Logs・Session Replay・Tracing・Profiling・Cron Monitoring・Uptime Monitoring を単一プラットフォームで提供する 特徴 5 行で組み込める SDK でセットアップが軽量(エージェント不要) エラー・ログ・リプレイ・スパン・プロファイル・メトリクスを 1 本のトレースで紐付ける Unified Context AI デバッガー Seer による Autofix / AI Code Review 20+ プラットフォーム / 60+ フレームワーク対応 https://sentry.io/
-
Book/SRE サイトリライアビリティエンジニアリング
-
クラウドネイティブで実現する マイクロサービス開発・運用 実践ガイド
-
Observability WhitepaperCNCFによる#Observabilityに関する文書 https://github.com/cncf/tag-observability/blob/main/whitepaper.md
-
Datadog/RUMReal User Monitoring #Observability Datadog上でRUMを提供する機能 APMと紐づける(以下、詳細)ことでフロントエンドで収集したデータをバックエンドのトレースと相関づけて追跡できる Connect RUM and Traces RUM Explorerでは、ユーザーセッションを1レコードとした探索が可能 https://docs.datadoghq.com/ja/real_user_monitoring/
-
Datadog/Database Monitoring#Observability #Data Engineering Datadog上でデータベースの詳細な可視性を提供する Explain Plansでは実行計画を容易に把握することができる 導入にはAPMの有効化が必須でありでクエリを呼んでいるサービスの内訳を可視化できる データベース モニタリング
-
Datadog/datadog-api-claude-plugin#Observability DatadogのAPIをClaude Codeから直接操作するためのPlugins。pup CLIをバックエンドとして利用する 46の専門エージェントがLogs、APM、モニター、ダッシュボード等の操作をガイド 読み取り/書き込み操作のパーミッション管理に対応 APIキーやユーザーデータは送信せずプライバシーに配慮 https://github.com/DataDog/datadog-api-claude-plugin
-
Datadog/Feature Flag Tracking#Observability DatadogのRUMの機能の一つとして提供されるフィーチャーフラグ可視化ツール フーチャーフラグ単位のグルーピングを行うことで機能リリースを安全に、迅速なトラブルシューティングが可能になる Flagsmithのようないくつかのツールで統合が容易になっている https://docs.datadoghq.com/real_user_monitoring/feature_flag_tracking/
-
Datadog/Logs#Observability Datadog上でログを扱い、高機能な検索機能等を利用できる 設定方法は以下 ログの収集とインテグレーション
-
Datadog/pup#Observability Datadogのメトリクス、Logs、APM等をターミナルから操作するためのCLIツール。AIエージェントからの利用にも対応している 認証はOAuth2 (PKCE) によるブラウザ認証。APIキー環境変数にも対応 https://github.com/datadog-labs/pup
-
Datadog/APMApplication Performance Monitoring #Observability Datadog上で分散トレースによってアプリケーションを詳細に可視化し、パフォーマンスボトルネックを特定するのに役立てる 設定方法は以下 アプリケーションインスツルメンテーション APM
-
Datadog/Error Tracking#Observability Datadog上でエラーを追跡・管理するモニタリング機能 すべてのイシューには FOR REVIEW / REVIEWED / RESOLVED などのステータスが設定され、トリアージと優先順位付けに利用される https://docs.datadoghq.com/error_tracking/ https://docs.datadoghq.com/error_tracking/issue_states/
-
オブザーバビリティ成熟度モデル
-
Datadog
-
Cilium#Network #Cloud Native #Observability #Security https://cilium.io/ eBPF技術を活用したクラウドネイティブなネットワーキングソフトウェア KubernetesのCNIとしてネットワークの接続、保護、監視を提供する ユースケースとして以下のような例がある L4 ロードバランシング https://cilium.io/use-cases/load-balancer/ kube-proxy https://cilium.io/use-cases/kube-proxy/ サービスメッシュ https://cilium.io/use-cases/service-mesh/ Gateway API https://cilium.io/use-cases/gateway-api/ Ingress https://cilium.io/use-cases/ingress/
-
Important Components for Kubernetes#Observability OpenTelemetry CollectorをKubernetes上で構築するコンポーネント群の説明 Prometeus Receiverの例ではDaemonSet(agent)またはDeployment(gateway)を用いた実装のサンプルコードが置かれている https://opentelemetry.io/docs/platforms/kubernetes/collector/components/
-
合成監視Synthetic Monitoring #Observability レスポンス内容が予測可能なリクエストを事前に定義し、定期的にシステムに送信し応答を監視するもの
-
Unknown unknowns#Observability 自分は意識も理解もしていないこと 未知のシステム故障への対応、が該当する
-
Observability Primary Signals
-
OpenObserveO2 #Observability #Cloud Native ログ、メトリクス、分散トレースを統合するオープンソースのオブザーバビリティプラットフォーム Rustで実装されており、Apache ParquetによるカラムナーストレージでElasticsearch比約140倍のストレージコスト削減を実現する。OpenTelemetryをネイティブサポートしている https://openobserve.ai/
-
計装#Observability テレメトリーをオブザーバビリティソリューションに送信するための実装のこと 前提としてエージェントをシステムに組み込んだ上で、アプリケーションエンドポイントへの自動計装や手動スパン埋め込み等のカスタム計装を行う
-
opentelemetry-go#Observability #Programming OpenTelemetryのGo APIまたはSDK https://github.com/open-telemetry/opentelemetry-go https://opentelemetry.io/ja/docs/languages/go/
-
OpenTelemetry/Collector#Observability OpenTelemetryにおいてDatadog, Jaeger, Prometeusのような各種バックエンドへのテレメトリー送信を集約し抽象化するような役割 https://opentelemetry.io/docs/collector/
-
OpenTelemetry/OpenTelemetryCollector#Observability Kubernetes上にOpenTelemetryのCollectorを構築するためのCRD/Operator https://github.com/open-telemetry/opentelemetry-operator?tab=readme-ov-file
-
OpenTelemetry
-
監視SaaSの運用におけるObservability改善の歩み#Observability キーワード Observability Primary Signals Unknown unknowns ログ/メトリクス/トレース OpenTelemetry オブザーバビリティ成熟度モデル
-
DevOps capabilities/Proactive failure notification#Observability DevOps capabilitiesの1つ、Fast Feedbackに分類される https://dora.dev/capabilities/proactive-failure-notification/
-
DevOps capabilities/Monitoring and observability#Observability DevOps capabilitiesの1つ、Fast Feedbackに分類される DORA | Capabilities: Monitoring and observability
-
XSAM/otelsql#Observability #Programming #Data Engineering Goのdatabase/sqlパッケージにOpenTelemetry計装を追加するライブラリ トレースとメトリクスの両方をサポート PostgreSQL、MySQL、SQLiteなど、database/sqlドライバを持つ任意のDBに対応 https://github.com/XSAM/otelsql
-
ログ#Observabilityにおけるテキストベースの記録 Observability Whitepaperを参考にすると、ログにはいくつかのカテゴリがある Application Logs Security Log System Log Audit Log Infrastructure Log またログレベルとして以下の4パターンがある ERROR WARNING INFO DEBUG
-
Argo Rollouts
-
メトリクス#Observability システムの状態を表すために収集された数値、例としてログを元に時間単位のHTTPリクエスト数をメトリクスとして収集する等 ログやトレースとは異なり詳細なデータは抜けているため、システムで何が起きているかの調査のスタート地点(アラート)となることが多い Observability Whitepaper システム状態を表すために収集されたスカラー値であり、オプションでタグが付与され、数値をグループ化したり検索したりすることがある オブザーバビリティ・エンジニアリング | P55
-
OCSFOpen Cybersecurity Schema Framework #Security #Observability サイバーセキュリティイベントのログ記録とデータ正規化のためのオープン標準スキーマフレームワーク AWS、Splunk、IBMなどが2022年に設立、2024年11月にLinux Foundationへ参画 ベンダー非依存のスキーマで異なるセキュリティツール間のデータ統合を簡素化 カテゴリ、イベントクラス、データ型、属性辞書で構成 https://ocsf.io/
-
Istio/Telemetory#Observability Kubernetes/Istio環境のサービスメッシュ内において、テレメトリーが生成される方法を定義するCRD 例としてOpenTelemetryのOpenTelemetry Collectorによるプロバイダを指定することができる https://istio.io/latest/docs/reference/config/telemetry/
-
gRPC
-
マスタリングAPIアーキテクチャ
-
InfoQ Cloud and DevOps Trends Report - 2025#Cloud Native InfoQが2025年の技術トレンドをキャズム理論による分類で整理したもの Innovators AI Agents for Cloud Engineering Practical, Early Automation of Governance Model Context Protocol (MCP) Early Adopters Platform Engineering Maturity Cross-cloud/Cloud-native hybrid approaches Developer Experience (DevEx) Frameworks Early Majority Focus on developer experience Service Mesh and eBPF Continuous Testing Late Majority FinOps Enterprise DevOps Toolchain #Observability https://www.infoq.com/articles/cloud-devops-trends-2025/
-
分散トレース#Observabilityにおいて分散トランザクションの各コンポーネントで何が発生したかを追跡する、単にトレースと呼ばれることもある 各コンポーネントに対応するデータポイントはスパンと呼ばれ、分散トレースはスパンの集合を扱う Observability Whitepaper
-
サービスメッシュ#Network #Observability #Security #API Architecture マイクロサービスで行われるようなサービス間通信をルーティング、監視、保護する機能を提供する Kubernetesにおいてはクラスタ単位でサービスメッシュを構築する サービスメッシュはクラスタ内の全てのサービス間通信を制御するコントロールプレーンとコントロールプレーンで指定された作業が実行されるデータプレーン(サービス)の2つの基本要素を持つ。
-
テレメトリー#Observability ログ、分散トレース、メトリクスのようなシステムの状態に関するデータ Datadogのようなオブザーバビリティソリューションに送信される
-
Deprecating Span Events API#Observability #Cloud Native OpenTelemetryのSpan Event API(Span.AddEvent、Span.RecordException)を非推奨とし、イベントをLogs APIベースに統一する方針 Span Eventsとログベースイベントの重複を解消し、「イベント = 名前付きログ」としてLogs APIで記録する 既存のSpan Eventデータは引き続き有効で、SDK互換レイヤーによりスパン上のイベント可視性も維持される https://opentelemetry.io/blog/2026/deprecating-span-events/ ブログ
-
適応度関数Fitness Function #API Architecture システムの品質特性を数量化可能な指標で評価する、システムの目標を一貫して保証するためにビルドパイプラインに組み込まれる それぞれの特性は以下のようにカテゴライズされる コード品質(Code Quality) レジリエンス(Resiliency) オブザーバビリティ(#Observability) パフォーマンス(Performance) コンプライアンス(Compliance) セキュリティ(#Security) 運用操作性(Operability) Fitness function-driven development | Thoughtworks
-
Honeycomb#Observabilityに関するエンドツーエンドのプロダクト Retrieverというオブザーバビリティに最適化された独自のデータストアを備えており、S3によって実装されている Honeycomb.io Documentation | Honeycomb
-
Prometeus