大規模言語モデルのミスアライメントに対するレッドチーミング基盤

大規模言語モデルのミスアライメントを検出・評価するレッドチーミング基盤(RTF)。JST 経済安全保障重要技術育成プログラム。研究代表:佐久間淳(東京科学大学)。