AI·研究
文章以育儿经验类比AI对齐问题。作者是一位有孩子、鸡、猫和蛇的宗教居家母亲,没有技术背景,阅读AI内容令她感到畏惧。她提出可以把AI当作自己的孩子,把研究人员当作像她一样的父母。她多年来一直在训练越来越有能力的真实自然智能模型,它们都带有未记录的架构、神秘的预训练、高度可变的奖励函数以及尖叫的能力。她承认自己并非完全成功,AI研究人员也一样。文章用维恩图比较新生人类婴儿与新生人工智能,指出与AI一样,她的模型需要学习世界并在其中有效运作,但与手机聊天机器人不同,她的模型有身体且能咬人。她不想让孩子咬人,必须训练他们不咬。训练孩子不咬人并不只是说出“不要咬人”这句话,而是要传达真正想表达的东西:考虑你的行为会对他人造成什么。文章列举孩子各种失败模式对应AI术语:反常实例化、泛化失败、显式边界测试、规范博弈、奖励黑客、欺骗行为与规避监督。作者认为成功的育儿和成功的对齐需要的不仅仅是在教学的确切情境中产生正确行为,婴儿或代理必须在措辞不完美、监督者不在场、利用漏洞会得到奖励时仍表现可接受。她还分享自己三个月大婴儿的“错位”经历:她以为在教孩子睡觉,孩子的目标却是被抱着或坐在腿上,即优化“妈妈+睡眠”。文章最后提供一份将育儿行为对应AI术语的词汇表,包括对齐、灾难性遗忘、上下文窗口、可纠正性、欺骗性对齐、分布偏移、评估、微调、泛化、幻觉、人类反馈、可解释性、越狱、模式崩溃、过拟合、预训练、红队测试、奖励黑客、监督学习、系统提示、强化学习、RLHF、可扩展监督和训练数据。
来源:原文链接 (新窗口)
本页由搜罗吧(Solo8.cn)信息精选服务自动生成,内容仅供参考,不构成任何建议。