タイトル: How to Catch an AI Liar: Lie Detection in Black-Box LLMs by Asking Unrelated Questions 著者: Lorenzo Pacchiardi, Alex J. Chan, Sören Mindermann, Ilan Moscovitz, Alexa Y. Pan, Yarin Gal, Owain Evans, Jan Brauner https://arxiv.org/…
引用をストックしました
引用するにはまずログインしてください
引用をストックできませんでした。再度お試しください
限定公開記事のため引用できません。