AI基盤とLLMOps

AIインフラ

アプリケーションがそれぞれ、提供元の認証情報、再試行のロジック、コストの露出を抱え込むべきではありません。私たちは、モデルへのアクセスを一元化するゲートウェイ層を作ります。だから提供元の選択はアーキテクチャ上の確約ではなく設定であり続けます。

事業上の課題

アプリケーションごとに別々の統合になっている

共通の層がなければ、各アプリケーションが個別に認証し、障害の扱いもばらばらで、支出の帰属もありません。提供元の変更はすべてのコードベースに手を入れることを意味します。障害が起きれば、たまたまそこを向いていたものが止まります。そして誰も全体の利用状況を見られないため、コスト管理は事後的になります。

私たちの取り組み

ゲートウェイ、ルーティング、キャッシュ、フェイルオーバー

認証情報を保持し、チームごとの上限を適用し、キャッシュできるものはキャッシュし、提供元が劣化したときは切り替えるゲートウェイを作ります。ルーティングは、最初に設定されたものではなくタスクに応じて適切なモデルへトラフィックを送ります。すべての呼び出しはトレースされ帰属が付くので、監査証跡とコストモデルの両方が成立します。アプリケーションは安定した内部インタフェースと話し、背後の提供元を気にしなくなります。

AIインフラ

提供できること

  • AIモデルゲートウェイ

  • モデルのルーティング

  • AIの可観測性

  • 推論基盤

  • キャッシュ

  • フェイルオーバー

  • マルチプロバイダAI基盤

代表的なユースケース

代表的なユースケース

  • 増え続けるAIアプリケーションの提供元アクセスを集約する。
  • 提供元の障害を、アプリケーションの停止なしに乗り切る。
  • 推論の支出をチーム単位で帰属させ、上限を適用する。
  • モデル提供元の切り替えや追加を設定変更で済むようにする。

進め方

進め方

  1. 評価

    制約を確定する。所在、応答時間、費用、そしてすでに動いているもの。

  2. 設計

    提供事業者の選択を後戻り可能に保つゲートウェイ、ルーティング、キャッシュ、フェイルオーバーを設計する。

  3. 計装

    トラフィックが来る前に、可観測性、評価、コスト按分を組み込む。

  4. 運用

    合意したサービス水準のもとで運用し、容量と費用を定期的に見直す。

テクノロジー

テクノロジー

  • Kubernetes
  • Terraform
  • vLLM
  • Ollama
  • LiteLLM
  • OpenTelemetry
  • Prometheus
  • Grafana
  • AWS
  • Microsoft Azure

セキュリティとガバナンス

セキュリティとガバナンス

どこでデータを処理してよいかは前提ではなく設定です。所在や分離が求められる場合、モデルは自社のクラウドテナントや自社機器上で動かせます。ゲートウェイを通るトラフィックは認証され、チームに紐づけられ、記録されます。それが監査証跡とコストモデルの両方を成り立たせます。

協業モデル

協業モデル

AIプロジェクト

定義されたAIソリューションの設計と提供について、私たちが責任を負います。

専任AIチーム

お客様の技術スタックと提供モデルに合わせて構築される、長期の専任エンジニアリング体制。

マネージドAI

本番のAIシステムを、私たちが運用・監視し、継続的に改善します。

TeamExtension.aiを選ぶ理由

後戻りできることを前提に作ります

今日下す提供元の判断は、18か月以内に誤りに見えます。市場は調達の周期より速く動くからです。その判断を安く見直せるように設計することは、最初から正解を当てることより価値があります。

主なお客様

よくあるご質問

よくあるご質問

ゲートウェイは遅延を増やしませんか。
数ミリ秒です。モデル側の遅延は数百ミリ秒単位で測られます。キャッシュにより正味の効果はたいてい負になります。繰り返しの呼び出しが提供元にまったく届かなくなるからです。
自作すべきか購入すべきか。
要件によります。有力なオープンソースのゲートウェイがいくつかあり、大半の要件を満たすので、合う場合はそれを導入します。データの所在、ID連携、ルーティングの論理が既製品では扱いにくい場合に作ります。
モデルごとに挙動が違う場合、フェイルオーバーはどう機能しますか。
切替先はあらかじめ選定し評価しておくので、単に使えるというだけでなく、そのタスクに対して許容できると分かっています。未検証のモデルへの黙った切替は、明確なエラーより悪いものです。
ポリシーの適用はできますか。
できます。すべてがそこを通るため、上限、チーム別の制限、内容の統制、ログの自然な置き場所です。ゲートウェイを持つ理由の大部分でもあります。

AI構想について相談する

ゲートウェイ、ルーティング、キャッシュ、フェイルオーバー。モデルの選択をアーキテクチャではなく設定に保ちます。