SRE<AI検索プラットフォームの信頼性向上>
AI検索機能(キーワード検索、ベクトル検索、AIレコメンド等)を提供するプラットフォームの信頼性向上、パフォーマンス改善、開発効率化をリードしていただきます。 【具体的には】 ■信頼性向上・スケーラビリティ確保:40% ・コンテナ基盤の高度化: GKE (Kubernetes) / Cloud Run を活用した、高負荷に耐えうるオートスケーリング基盤の構築と運用 ・SLI/SLOの導入・運用: サービスの信頼性を定義し、エラーバジェットに基づいた運用ルールの策定と、開発チームへの信頼性文化(Reliability Culture)の浸透 ・グローバルインフラ設計: 各国のレイテンシ要件を満たすマルチリージョン構成やCDN戦略、ネットワーク設計の最適化 ■パフォーマンス・エンジニアリング・可観測性:40% ・検索基盤の高速化: Elasticsearchやベクトル検索エンジンのインデックス設計、クエリパフォーマンスのボトルネック特定と解消 ・分散トレーシングの確立: マイクロサービスとAIモデルを横断するリクエストフローを可視化し、障害発生時の原因特定時間を短縮 ・コスト最適化 (FinOps): クラウドコストやAIリソース(GPU等)の使用状況を監視し、性能を維持しつつのコスト削減を提案・実行 ■DevEx向上・チームマネジメント:20% ・Toil(労苦)の削減: 手作業によるオペレーションを自動化し、エンジニアが創造的な作業に集中できる時間を創出 ・CI/CDパイプラインの進化: テスト自動化、カナリアリリース等のデプロイ戦略を実装し、安全かつ高速なリリースサイクルを実現 ・技術共有・育成: SREプラクティスの勉強会実施やコードレビューを通じ、開発メンバーのインフラ・運用スキルの底上げを図る。