AIデータとモデル
モデルエンジニアリング
企業のユースケースの多くは、優れた検索を備えた高性能な汎用モデルで十分に足ります。そうでないものもあります。狭い専門領域、大量処理、厳しい遅延要件、あるいは自社の境界から出せないデータです。私たちはそこを担当します。
事業上の課題
ファインチューニングに手を出すのが早すぎる
本当は検索やプロンプトの問題だったものを直そうとしてファインチューニングし、以後は基盤モデルが変わるたびに保守・評価・再調整しなければならないモデルを抱え込みます。その費用は継続的に発生し、予算に計上されることは稀です。その一方で、大量処理時のコスト、遅延、オフライン運用、汎用モデルが苦手とする専門用語といった、カスタマイズが本当に妥当な場面は見落とされます。
私たちの取り組み
妥当かどうかを見極め、その上できちんとやる
まず、検索、プロンプト、あるいは別の基盤モデルで問題が解けないかを検証します。そのほうが作るのも保有するのも安く済むのが通例だからです。カスタマイズが本当に妥当な場合は、データセットを作り、学習を行い、お客様自身の事例から取り分けた検証集合で評価します。提供基盤はお客様の遅延とコストの範囲に合わせて設計し、バージョン管理と切り戻しを備えます。本番のモデルは、そこから退けることが必要な成果物だからです。
モデルエンジニアリング
提供できること
-
ファインチューニング
-
モデルのカスタマイズ
-
埋め込み
-
モデルの最適化
-
モデルの提供基盤
-
オープンソースモデル
代表的なユースケース
代表的なユースケース
- 大部分のトラフィックを小さな専用モデルに移し、大量処理時の推論コストを下げる。
- 汎用モデルが一貫して誤る専門用語を正しく扱う。
- データが外部APIに出せない場合に、自社の境界内で完結して動かす。
- ホスト型の最先端モデルでは満たせない遅延要件に応える。
進め方
進め方
-
棚卸し
どんなデータが存在し、誰が保有し、実際どんな状態かを明らかにする。
-
パイプライン
モデルが依存する取り込み、変換、品質チェックを構築する。
-
比較検証
公開のランキングではなく、自社データ上で手法を比較する。
-
提供
バージョン管理、監視、切り戻し経路を備えた安定インターフェースの背後に配置する。
テクノロジー
テクノロジー
- Python
- dbt
- Apache Airflow
- Snowflake
- Databricks
- PostgreSQL
- pgvector
- PyTorch
- Hugging Face
セキュリティとガバナンス
セキュリティとガバナンス
データの来歴は端から端まで記録されるため、ある値がどこから来て、どのモデルバージョンがその出力を生んだのかに常に答えられます。個人データは既定ではなく明示的な方針のもとで最小化・分類・保存されます。学習用と評価用のデータセットは、それを使うコードと一緒にバージョン管理されます。
協業モデル
協業モデル
AIプロジェクト
定義されたAIソリューションの設計と提供について、私たちが責任を負います。
専任AIチーム
お客様の技術スタックと提供モデルに合わせて構築される、長期の専任エンジニアリング体制。
マネージドAI
本番のAIシステムを、私たちが運用・監視し、継続的に改善します。
TeamExtension.aiを選ぶ理由
たいていは思いとどまるようお勧めします
カスタマイズが妥当な場面は、提案される頻度よりずっと少ないものです。売るよりも、そう申し上げるほうを選びます。妥当な場合の仕事は地味です。データセットの構築、正直な評価、そしてお客様が運用できる提供経路。それが持ちこたえるかどうかを決める部分です。
主なお客様
よくあるご質問