0 / 4 節読了

PIHFとは何か

生成事前学習という手法は、再利用可能なタスク表現を生み出しました。その後の研究では、言語によるタスク条件付けや文脈内学習により、固定されたAIが指示や例から振る舞いを調整できると示されました。

PIHF(Policy Iteration with Human Feedback)は、この進展と反復的な評価・改善の仕組みを基にしています。PIHFは、事前学習済みの言語AIを実行の土台として使います。そして、継続的な修正をバージョン管理された自然言語の方針とツール群に組み込む仕組みです。

専門家とAIの協調

言語AIの評価役と臨床の専門家が、全体的な推論やツール利用の過程をレビューします。これにより、繰り返される失敗を見つけ出し、修正案を作ります。専門家は証拠を再解釈できます。そして、修正の承認や差し戻しの権限を保持します。

修正案が実行された後には、リコール@1やリコール@5といった精度指標で結果を検証します。この手法は、人間がAIの学習サイクルに深く関わることで、その能力を高めることを目指しています。

希少疾患診断での効果

PIHFから生まれた方針は、複数のAIシステムで精度を大幅に向上させました。独自の実行システム一つと、オープンな実行システム三つで効果を確認しています。これらのシステムは、30億から490億の稼働パラメータを持つものです。

GPT-5.4では32.7ポイント、Qwen3.6-35Bでは31.1ポイントの精度向上が見られました。この結果は、事前学習済みAIを固定された実行の土台として活用できる可能性を示しています。専門家主導の方針開発が、希少疾患の診断において有効であると裏付けています。

私の見方

AIの能力は、いかに人間が「方針」を洗練させるかにかかっています。ただ賢いAIを作るだけでは不十分です。人間がAIをどう使うかの設計が全てです。このPIHFは、その設計の重要性を明確に示しています。

私の経験上、AIは完璧ではありません。しかし、人間が適切なフィードバックを与え、その方針を改善し続けることで、AIは驚くべき能力を発揮します。このアプローチは、医療だけでなく、様々な分野でAIの活用を加速させるでしょう。

柴亮太
柴亮太の視点

AIの能力は、いかに人間が「方針」を洗練させるかにかかっています。ただ賢いAIを作るのではなく、人間がAIをどう使うかの設計が全てです。この手法は、AIを使いこなすための一次情報です。