AIデータとモデル

モデルエンジニアリング

企業のユースケースの多くは、優れた検索を備えた高性能な汎用モデルで十分に足ります。そうでないものもあります。狭い専門領域、大量処理、厳しい遅延要件、あるいは自社の境界から出せないデータです。私たちはそこを担当します。

事業上の課題

ファインチューニングに手を出すのが早すぎる

本当は検索やプロンプトの問題だったものを直そうとしてファインチューニングし、以後は基盤モデルが変わるたびに保守・評価・再調整しなければならないモデルを抱え込みます。その費用は継続的に発生し、予算に計上されることは稀です。その一方で、大量処理時のコスト、遅延、オフライン運用、汎用モデルが苦手とする専門用語といった、カスタマイズが本当に妥当な場面は見落とされます。

私たちの取り組み

妥当かどうかを見極め、その上できちんとやる

まず、検索、プロンプト、あるいは別の基盤モデルで問題が解けないかを検証します。そのほうが作るのも保有するのも安く済むのが通例だからです。カスタマイズが本当に妥当な場合は、データセットを作り、学習を行い、お客様自身の事例から取り分けた検証集合で評価します。提供基盤はお客様の遅延とコストの範囲に合わせて設計し、バージョン管理と切り戻しを備えます。本番のモデルは、そこから退けることが必要な成果物だからです。

モデルエンジニアリング

提供できること

  • ファインチューニング

  • モデルのカスタマイズ

  • 埋め込み

  • モデルの最適化

  • モデルの提供基盤

  • オープンソースモデル

代表的なユースケース

代表的なユースケース

  • 大部分のトラフィックを小さな専用モデルに移し、大量処理時の推論コストを下げる。
  • 汎用モデルが一貫して誤る専門用語を正しく扱う。
  • データが外部APIに出せない場合に、自社の境界内で完結して動かす。
  • ホスト型の最先端モデルでは満たせない遅延要件に応える。

進め方

進め方

  1. 棚卸し

    どんなデータが存在し、誰が保有し、実際どんな状態かを明らかにする。

  2. パイプライン

    モデルが依存する取り込み、変換、品質チェックを構築する。

  3. 比較検証

    公開のランキングではなく、自社データ上で手法を比較する。

  4. 提供

    バージョン管理、監視、切り戻し経路を備えた安定インターフェースの背後に配置する。

テクノロジー

テクノロジー

  • Python
  • dbt
  • Apache Airflow
  • Snowflake
  • Databricks
  • PostgreSQL
  • pgvector
  • PyTorch
  • Hugging Face

セキュリティとガバナンス

セキュリティとガバナンス

データの来歴は端から端まで記録されるため、ある値がどこから来て、どのモデルバージョンがその出力を生んだのかに常に答えられます。個人データは既定ではなく明示的な方針のもとで最小化・分類・保存されます。学習用と評価用のデータセットは、それを使うコードと一緒にバージョン管理されます。

協業モデル

協業モデル

AIプロジェクト

定義されたAIソリューションの設計と提供について、私たちが責任を負います。

専任AIチーム

お客様の技術スタックと提供モデルに合わせて構築される、長期の専任エンジニアリング体制。

マネージドAI

本番のAIシステムを、私たちが運用・監視し、継続的に改善します。

TeamExtension.aiを選ぶ理由

たいていは思いとどまるようお勧めします

カスタマイズが妥当な場面は、提案される頻度よりずっと少ないものです。売るよりも、そう申し上げるほうを選びます。妥当な場合の仕事は地味です。データセットの構築、正直な評価、そしてお客様が運用できる提供経路。それが持ちこたえるかどうかを決める部分です。

主なお客様

よくあるご質問

よくあるご質問

ファインチューニングにはどれくらいのデータが必要ですか。
文体や書式については一般に思われているよりはるかに少なく、よく選んだ数百件で足りることも多いです。本当に新しい知識を教えるのは別の問題で、たいてい検索で解くほうが適しています。
ファインチューニングしたモデルは最先端モデルに勝てますか。
狭いタスクでは勝つことがあり、コストと遅延はたいてい大きく下がります。一般的な推論では勝てません。現実的な形は、小さなモデルが大部分を処理し、難しい事例だけ上位に回す構成です。
基盤モデルが更新されたらどうなりますか。
お客様のファインチューニングは一緒には動かないので、再評価が必要で、多くの場合は再学習になります。この継続的な費用も判断材料の一部であり、お決めになる前に明示します。
オープンソースのモデルを自社で動かせますか。
できますし、データの所在や分離を理由にそうすることは多いです。ただし推論基盤を運用することを意味し、実際の費用が伴うので、既定ではなく意図した選択であるべきです。

AI構想について相談する

ファインチューニング、埋め込み、最適化、提供基盤。オープンソースや自社運用のモデルを含みます。