データエンジニア<データ品質管理・パイプライン開発>
■AI検索サービス向けデータ基盤において、データの品質保証(Data Quality)、およびETLパイプラインの実装・運用をご担当いただきます。 【具体的には】 ■データ品質管理(Data Quality)の実装と監視:40% AIモデルが常に「正しいデータ」を利用できるよう、データの品質を監視・維持する仕組みを実装していただきます。 ・データテストの実装:Dataformやdbt等を用い、データの欠損・重複・異常値を検知するテストコード(Assertion)の作成と実装 ・モニタリング環境の整備:データの鮮度や品質低下を検知した際、即座にSlack等へ通知し、原因を特定できるダッシュボードや監視フローの構築 ・データリネージの管理:データの発生源から利用箇所までの流れ(リネージ)を整理し、メタデータ管理ツールへの登録・更新を行い、トレーサビリティを確保 ■データパイプライン(ETL/ELT)の開発・改善:40% 設計されたアーキテクチャに基づき、実際のデータ処理フローを開発していただきます。 ・ETL処理の実装:PythonやSQLを用いて、ログデータや商品データを収集・加工する処理のコーディング ・ワークフローの移行・自動化:手動で行われている既存のデータ処理を、WorkflowEngine(Airflow/VertexAIPipelines)上での自動実行ジョブへ書き換え ・パフォーマンスチューニング:クエリの最適化を行い、データ処理時間の短縮やコスト削減(BigQueryのコスト管理等) ■データサイエンティストとの連携・サポート:20% データサイエンティストからの「こんな特徴量が欲しい」「データがおかしい」といった要望・問い合わせに対し、SQLを用いた調査やデータ抽出、マート作成を行っていただきます。