タグ: SRE
「SRE」に関連する記事を表示しています。
RedisをMySQLに置き換えたShopify事例に学ぶ在庫予約設計の落とし穴
ShopifyがRedisをMySQLに置き換えて在庫予約をスケールさせた事例から、状態管理をどこに置くべきかの判断基準と移行手順を整理しました。
git pull本番運用の落とし穴、デプロイ鍵削除で13分の復旧が数時間に
cronでgit pull本番デプロイしていませんか。デプロイ鍵の削除が招いた503障害の原因分解と、IaC・CI/CD移行での対策を整理しました。
AWS運用のフィードバックループをSREのポストモーテムに変換する方法
AWSコミュニティのフィードバック文化を手がかりに、SREのポストモーテムやSLOレビューを機能させる仕組みを整理しました。
アンビエントAIスキャイブ導入で起きる同意記録の落とし穴と監視設計
アンビエントAIスキャイブが同意記録まで自動捏造した事例から、クラウドAPI連携の監視盲点と対策手順を整理しました。
Java 26のPanama移行、業務システムで急ぐと起きる3つの落とし穴
Java 26のPanama・仮想スレッドとKubernetes 1.35を既存の業務システムに導入する際に起きやすい3つの落とし穴と、確認・対策の手順を整理しました。
分散型SNS基盤ATProtocolは自社インフラで採用すべきか判断する4条件
Bluesky新CEOの発言を手がかりに、分散型プロトコル採用の可否をSRE視点の4軸(運用主体・コスト・監視・SLO設計)で判断する方法を整理しました。
マルチエージェントAI基盤設計、単一エージェントとの分離判断5つの軸
コーディングとテストを同一エージェントに任せると確認バイアスが起きます。マルチエージェント化すべきか、判断軸と選択肢を整理しました。
AI生成Terraform・Dockerfileが招く落とし穴、深夜障害で気づく前に
AIが生成したTerraformやDockerfileをそのまま使う運用に潜むリスクと、障害対応・コスト管理まで含めた確認手順を整理しました。
Argo CDのGitOpsハブが20,000オブジェクトでOOM落ちする理由と対策
Argo CDのGitOpsハブがクラスタ数ではなくオブジェクト数でOOM落ちする仕組みと、確認コマンド・対策手順を整理しました。
障害ポストモーテムを公開する前に確認すべき3つの落とし穴
障害対応の記録を技術ブログとして公開する動きに合わせ、クラウド運用ドキュメントに潜む情報漏洩リスクと確認手順を整理しました。
OpenAI国家科学イニシアチブから読む研究基盤へのAI導入の判断軸
OpenAIの国家科学イニシアチブを題材に、大規模AI利用契約を組織として受け入れる際の予算ガバナンス・障害対応・依存リスクの判断軸を整理しました。
Claude Code の MCP サーバー、Hosted と Local どちらを選ぶか
Claude Code に MCP サーバーを繋ぐ際の Hosted HTTP と Local stdio の違いを、SRE の運用責任・再現性・デバッグ性の観点から比較し判断基準を整理しました。