Podcast · Episode 261
中国語大規模コーパスのWeb汚染監査:新手法Sampled-BPEで高速・高精度を実現
8月22日(土) · 6分
大規模言語モデル(LLM)における中国語Webデータの汚染は深刻な問題です。その監査は、膨大な規模、粒度の粗さ、汚染の急速な変化という課題を抱えていました。今回、これらの課題を克服する軽量なトークンレベル監査パイプライン「Sampled-BPE」が提案されました。この手法は、大幅な高速化とメモリ削減を実現しつつ、高い精度で汚染を検出します。実際のコーパス監査では、広範かつ不均一な汚染の実態が明らかになり、汚染追跡のためのデータセットも公開されました。