CausalPilot

決定論的な因果ツールと選択的な行動権限による、エビデンスをゲートとした実験。

研究課題

実験予算と人間の注意力が限られているとき、エージェントが行動を許可されるには、どのようなエビデンスが必要でしょうか。CausalPilot は、言語モデルによる提案と、診断、プロービング、人間へのエスカレーション、デプロイ、一時停止、ロールバック、行動を見送る権限を担う決定論的ゲートを分離します。

アプローチ

このプロジェクトは、FastAPI のステートマシン、決定論的な統計ツール、明示的なモデル/因果/データ/環境リスク信号、Next.js のコントロールルームを組み合わせています。リポジトリに収録されたベンチマークでは、シミュレーターの隠れた真値をポリシーから分離し、報告された実行を監査できるよう、シード、生の意思決定、区間、フィクスチャ、設定フィンガープリントを保存しています。

リポジトリの 3D コントロールルームです。ホスト版の数値は、実際の事業計測値ではなくシミュレーションであると明記しています。

エビデンスと境界

現在の成果物は、制御されたシミュレーション上のエンジニアリング・ベンチマークであり、因果研究の結論でも、実事業での効果向上を主張するものでもありません。「LLM」と名付けたベンチマークポリシーは意思決定ルールの代理であり、標準実行ではモデル API を呼び出していません。収録結果は、カバレッジを揃えた条件での優位性、校正されたリスク確率、実モデルの計画品質、安全な企業導入のいずれも立証しません。

成果物と出典