← ポッドキャスト一覧に戻る
Podcast · Episode 261

中国語大規模コーパスのWeb汚染監査:新手法Sampled-BPEで高速・高精度を実現

8月22日(土) · 6分
大規模言語モデル(LLM)における中国語Webデータの汚染は深刻な問題です。その監査は、膨大な規模、粒度の粗さ、汚染の急速な変化という課題を抱えていました。今回、これらの課題を克服する軽量なトークンレベル監査パイプライン「Sampled-BPE」が提案されました。この手法は、大幅な高速化とメモリ削減を実現しつつ、高い精度で汚染を検出します。実際のコーパス監査では、広範かつ不均一な汚染の実態が明らかになり、汚染追跡のためのデータセットも公開されました。
前のエピソード会話型AIの状態を動的に表示する新手法「Signal Rail」発表 次のエピソードAIチャットボットは関係性を自ら築くのか?最新研究が示す能動的エンゲージメント