0 / 4 節読了

何が起きたか

NAVSIM v2.2の自動運転防御運転評価システムに、重大な信頼性問題が発見されました。この評価システムでは、エージェントと人間ドライバー(参照)の挙動を比較し、防御運転能力を測ります。しかし、特定の条件下で、周囲の状況を全く考慮しない「Ignore-All」のような単純なエージェントが、人間ドライバーやより高度なエージェントよりも高いスコアを獲得する現象が確認されました。これは、評価システムが本来の目的を果たせていないことを示しています。 この問題は、エージェントと参照の「共有ロールアウト変換」が不安定な場合に発生します。参照ドライバーがコンプライアンス違反を起こした場合、本来はエージェントの評価に影響しないはずですが、この不安定性により、参照の失敗がエージェントのコンプライアンススコアに不当に加算されてしまうのです。結果として、実際には性能が低いエージェントが、見かけ上は高い防御運転能力を持つと評価されてしまう状況が生じます。

問題の具体的な検証

私はNAVSIM v2.2のオリジナルシーン単一ステージスコアリングを監査しました。その結果、ルートを無視する「Ignore-All」プローブや、周囲の車両を認識しない「actor-blind」プローブが、人間によるリプレイデータや「PDM-Closed」といった高度なエージェントを上回るスコアを出すことを確認しました。これは、12,146トークンの大規模なナビテスト分割全体で一貫して見られた現象です。 さらに、公開されている仕様に従って新規インストールした環境でも、32トークンの診断セットでロールアウトの乖離が再現されました。これは、特定の環境設定や依存関係に起因するものではなく、NAVSIM v2.2の基本的な数値バックエンドに内在する問題であることを示唆しています。依存関係スタックの制御や厳密な入力診断を通じて、共有される速度再適合における依存関係に敏感な数値挙動が特定されました。

原因と解決策

この問題の直接的な原因は、評価システムの数値的不安定性です。特に、エージェントと参照の速度を再適合させるプロセスにおいて、特定の依存関係が数値的な挙動に影響を与え、不安定な結果を生み出していました。この不安定性が、参照が失敗した際にエージェントに不当なコンプライアンスクレジットを与える「参照条件付き許容(reference-conditioned forgiveness)」ルールと組み合わさることで、スコアの歪みが拡大していました。 私は450トークンの制御プールで検証を行い、ソルバーのみを置き換えることで、ロールアウトの乖離が解消され、本来あるべき「盲目的なエージェントが最下位になる」順序が回復することを確認しました。この際、「参照条件付き許容」は有効なままでした。この結果は、数値的不安定性が直接的なトリガーであり、それが参照失敗の共有をコンプライアンスクレジットに伝播させていたことを明確に示しています。

業界への提言と今後の展望

自動運転システムの安全性評価は、その信頼性が極めて重要です。今回のNAVSIM v2.2の事例は、評価システムの設計や実装における数値的安定性の確保がいかに重要であるかを浮き彫りにしました。私は、このような防御運転に関する主張のためにスコアを使用する前に、以下の監査プロトコルを義務付けるべきだと考えます。 具体的には、スコアの根拠とスタックの開示、盲目的なプローブの実施、上書きレポートの提出、そしてロールアウト安定性テストの実施です。これらの措置を通じて、評価システムの透明性と堅牢性を高め、自動運転技術の真の進歩を支える必要があります。業界全体で、評価基準の厳格化と数値的安定性の確保に取り組むことが、信頼できる自動運転社会の実現には不可欠です。

柴亮太
柴亮太の視点

NAVSIMの評価問題は、自動運転の「何をもって安全とするか」という根幹を揺るがします。数値的不安定性でスコアが歪むのは論外です。評価システム自体を常に監査し、一次情報で改善をぐるぐる回すのが正解です。