AI基盤とLLMOps
MLOps
需要予測、スコアリング、分類、異常検知は、多くの企業で生成AIより大きな本番負荷を担っています。私たちはその周りのライフサイクルを作ります。デプロイ、監視、再学習、切り戻しです。
事業上の課題
その判断を下したモデルが特定できない
モデルはノートブックからデプロイされ、手作業で再学習され、ファイル名でバージョン管理されます。半年後には、ある判断をどのバージョンが出したのか、何のデータで学習したのか、今も性能が出ているのかを誰も言えません。規制当局や監査人が尋ねうる事柄については、それは技術的負債の問題ではなく露出です。
私たちの取り組み
ライフサイクルを退屈にする
モデルは、それを生んだデータとコードとともにバージョン管理し、手作業ではなくパイプラインを通じてデプロイし、安定したインタフェースの背後で提供します。性能と入力分布を監視するので、ドリフトは事業成果から推測するのではなく検知されます。再学習はスケジュールまたは契機で起動し、取り分けた検証集合で評価し、稼働中のものを上回った場合にのみ昇格させます。切り戻しは日常の操作です。
MLOps
提供できること
-
MLのデプロイ
-
モデルのライフサイクル管理
-
監視
-
再学習
-
ML向けCI/CD
-
モデルレジストリ
代表的なユースケース
代表的なユースケース
- ノートブックから動いているモデルを、統制されたデプロイのパイプラインに乗せる。
- 現在は誰も性能を追跡していないモデルのドリフトを検知する。
- 規制対象の判断を支えるモデルについて再現性を確立する。
- 今は誰かが忘れずに実行している手作業の再学習を自動化する。
進め方
進め方
-
評価
制約を確定する。所在、応答時間、費用、そしてすでに動いているもの。
-
設計
提供事業者の選択を後戻り可能に保つゲートウェイ、ルーティング、キャッシュ、フェイルオーバーを設計する。
-
計装
トラフィックが来る前に、可観測性、評価、コスト按分を組み込む。
-
運用
合意したサービス水準のもとで運用し、容量と費用を定期的に見直す。
テクノロジー
テクノロジー
- Kubernetes
- Terraform
- vLLM
- Ollama
- LiteLLM
- OpenTelemetry
- Prometheus
- Grafana
- AWS
- Microsoft Azure
セキュリティとガバナンス
セキュリティとガバナンス
どこでデータを処理してよいかは前提ではなく設定です。所在や分離が求められる場合、モデルは自社のクラウドテナントや自社機器上で動かせます。ゲートウェイを通るトラフィックは認証され、チームに紐づけられ、記録されます。それが監査証跡とコストモデルの両方を成り立たせます。
協業モデル
協業モデル
AIプロジェクト
定義されたAIソリューションの設計と提供について、私たちが責任を負います。
専任AIチーム
お客様の技術スタックと提供モデルに合わせて構築される、長期の専任エンジニアリング体制。
マネージドAI
本番のAIシステムを、私たちが運用・監視し、継続的に改善します。
TeamExtension.aiを選ぶ理由
これはモデルに適用した普通のエンジニアリングです
バージョン管理、パイプライン、監視、切り戻しはソフトウェアでは解決済みの問題です。モデルに一貫して適用されていないのは、モデルがエンジニアリングではなくデータサイエンス経由で入ってきたからにすぎません。私たちは、データサイエンスのチームが作ったものを捨てずに、エンジニアリングの規律を持ち込みます。
主なお客様
よくあるご質問