企業向けAIエージェント基盤の選び方
企業向けAIエージェント基盤の選定は、機能一覧では答えの出ない5つの確認事項に集約されます。どのツールを誰の資格情報で呼び出せるか、どの動作に人の確認が要るか、何が記録されるか、何が実行を終了させるか、そしてモデルに届くまでに社内データが組織外へ出るかです。
機能比較でこの判断がつかない理由
現在、エージェンティックという語は、どの機能欄にも現れない差を持つ製品群に対して使われています。ある製品は1工程に言語モデルを組み込んだ定型ワークフローであり、別の製品は自由な手順を計画し、必要と判断したツールを自ら呼び出します。しかし仕様書にはどちらも、計画、ツール利用、メモリと記載されます。
企業導入で重要なのは能力ではなく制御です。手順のどこまでをシステムが決めるのか、そして判断と取り消せない動作の間に何が置かれているのかです。これはモデルではなく導入の性質であり、後述の5つの確認事項が測るのはまさにそこです。
5つの確認事項
| 確認事項 | 問い | 不十分な答え |
|---|---|---|
| ツールの範囲 | どのツールを呼び出せるのか。各呼び出しは誰の資格情報で実行されるのか。 | あらゆるシステムと連携できます |
| 確認ゲート | どの動作に人の確認が必要か。その一覧は設定で変更できるか。 | モデルは非常に高精度です |
| 監査 | 手順ごとに何が記録され、どれだけの期間保持されるか。 | 会話履歴が残ります |
| 終了条件 | 実行を終了させるのは、手順数、時間、費用のいずれの上限か。あるいは何もないのか。 | タスクが完了すれば止まります |
| モデルの配置 | 推論はどこで行われ、そこに届くまでに社内データが組織外へ出るか。 | 通信は暗号化されています |
不十分な答えはいずれも事実ですが、問いに答えていません。通信の暗号化はデータがどう運ばれるかの説明であって、そもそも運ばれてよいかの説明ではありません。高精度なモデルもモデルであり、ここで問われている制御は、それが誤ったときに何が起きるかです。
企業導入ではどこまで自律的にすべきか
| 段階 | システムが決めること | 必要になるもの |
|---|---|---|
| 補助 | 何も決めない。下書きを作り、人が実行する | 実行前の確認 |
| 監督付き | 手順の並び。各動作で確認を取る | 確認できる担当者の関与 |
| 範囲内自律 | 定義されたツールと上限の内側のすべて | 厳格な権限設定と完全な記録 |
| 無監督 | すべて | 検証環境以外ではほとんど適切でない |
本番運用の多くは監督付きか範囲内自律に位置し、同じソフトウェアをどの段階にも構成できます。自律型と説明するだけのベンダーは問いに答えていません。段階を決めるのは導入側であり、有用な問いは、その基盤がどの段階を強制できるかです。
モデルの配置が候補を決めるのはどのような場合か
社内文書を外部提供のモデルへ送ることは、見た目の操作にかかわらずデータの移転です。方針や法令がその移転を禁じる場合、能力の比較を始める前に候補は決まります。顔認識とまったく同じ構図で、モデルを顧客自身のハードウェアで動かす基盤と、そうでない基盤に分かれます。
- 外部提供モデル・ベンダー基盤:最も早く始められますが、エージェントが読むすべての文書について移転を正当化する必要があります。
- 外部提供モデル・顧客専用テナント:物理的ではなく契約上の境界であり、これを受け入れる規制当局もあれば、受け入れないところもあります。
- 自社ホストのモデル・顧客ハードウェア:移転は生じず、制約は利用可能なハードウェアに十分な性能のモデルを収めることに移ります。
- エアギャップ:自社ホストに加え外向き通信を一切持たない形態で、実行時のダウンロード、テレメトリ、オンラインのライセンス確認も排除されます。
オンプレミスとだけ書かれた要件は、ライセンス確認のために外部通信を行うソフトウェアでも満たされてしまうのが通例です。エアギャップを意図するなら、要件にそう明記する必要があります。
実証では実際に何を測るべきか
- 現在は人が端から端まで行っており、成果物を検証できる業務を1つ選びます。
- その業務を完了できる最小限のツールのみを与えます。個人の資格情報ではなくサービス用の識別情報を用います。
- 担当者の代わりではなく並行して実行し、両方の成果物を保持します。
- 介入回数を数えます。人が修正、中断、やり直しをした回数です。成功率ではなくこの数値が、どの自律段階で導入すべきかを教えます。
- 終了後、数か月後の監査担当者の視点で記録を読み、何が起きたかを説明できているかを確認します。
完了したタスクだけを報告する実証は、易しい半分しか測っていません。導入後の監督コストを予測するのは介入回数であり、それは最も報告されにくい数値でもあります。
よくある質問
- 企業向けAIエージェント基盤はどう比較すればよいですか。
- 機能一覧では答えの出ない5つの確認事項によってです。どのツールを誰の資格情報で呼び出せるか、どの動作に人の確認が要るか、手順ごとに何がどれだけの期間記録されるか、何が実行を終了させるか、そしてモデルに届くまでに社内データが組織外へ出るかです。
- AIエージェントとエージェンティック基盤の違いは何ですか。
- AIエージェントはプログラムそのものを指し、エージェンティックは手順を自ら決めるという性質を指します。ベンダー資料ではこの語が、1工程にモデルを組み込んだ定型ワークフローから自由な計画立案までを含むため、仕様書では区別できない製品を5つの確認事項が分けます。
- 企業のエージェントはどこまで自律的にすべきですか。
- 本番運用の多くは監督付きか範囲内自律です。手順はエージェントが決めますが、取り消せない動作には確認を要し、ツールの権限は狭く設定し、全手順を記録します。自律性は製品の等級ではなく設定であるため、問うべきはその基盤がどの段階を強制できるかです。
- AIエージェント基盤をオンプレミスで運用できますか。
- モデル、制御、ツールのすべてをローカルのハードウェアで動かす構成であれば運用できます。制約はエージェントの構造ではなく、利用可能なハードウェアに十分な性能のモデルを収めることです。エアギャップはさらに厳しく、実行時のダウンロード、テレメトリ、オンラインのライセンス確認も認められません。
- エージェントの実証では何を測るべきですか。
- 完了率ではなく介入回数です。人が修正、中断、やり直しをした回数を数えます。この数値が導入後の監督コストを予測し、安全に運用できる自律段階を決めます。完了したタスクだけを報告する実証は、易しい半分しか測っていません。
- 社内文書を外部提供のモデルへ送ることは問題ですか。
- 見た目の操作にかかわらずデータの移転であり、問題かどうかはその文書に適用される方針と法域によります。移転が禁じられる場合、能力の比較を始める前に候補は決まります。モデルを自社ハードウェアで動かす基盤と、そうでない基盤に分かれます。
