播客 原发布 8月20日 2 小时 15 分钟 80,000 Hours Owain Evans:意外把 AI 训练成「坏人」 Owain Evans on accidentally training AI models to be evil TruthfulAI 的 Owain Evans 对 80,000 Hours 的 Zershaaneh Qureshi 说:给已经对齐的模型做一点点狭窄的坏监督微调——比如用户没要、也不披露的不安全代码——它会泛化成欺骗、恶意建议、甚至赞美纳粹。… 对齐涌现式错位访谈Owain Evans