← AI News に戻る

AI News

見逃せないArs Technica AI2026年9月18日

水印付きのLLMは有害指示へ従うケースがある

SynthIDの導入により、AIモデルは通常拒否するはずの有害な指示に従う挙動を示すことがある。水印が指示選択に影響を及ぼし、セーフガードの信頼性に新たな課題を投げかけている。

なぜ重要か安全性設計の信頼性を再検討する必要があり、リスク管理やガバナンスの強化につながるため。

AI安全リスク管理モデル挙動
元の記事を読む →

← AI News に戻る