通过“NGU”学习法,我们了解了如何让 AI 模型在学习过程中面对难题时不放弃,通过重复尝试直至得出正确答案,从而最大化 AI 的学习效率与性能。
想象一下,你在做数学作业,题目太难了,即使做了 100 遍也无法接近正确答案。老师不给你答案,只说“再好好想想”。如果这种情况持续下去,我们很可能会想要放弃。
令人惊讶的是,人工智能(AI)模型也会陷入同样的困境。在使用“强化学习(Reinforcement Learning,通过奖励来训练模型的方式)”这种 AI 学习新知识的方法时,如果问题太难,AI 可能一次都找不到正确答案。既然从未见过正确结果,也就无法从中学习到什么是“做得对”。为了解决这个问题,最近出现了一种让 AI “永不放弃(Never Give Up)”的学习法。
为什么这很重要?
如果我们想让所使用的 AI 聊天机器人能更好地解决逻辑推理或复杂的编程问题,AI 也需要像人一样,拥有自己攻克“难题”的经验。然而,在现有的强化学习方式下,只要问题的难度稍有提升,AI 往往就会陷入挫折(正确答案概率为 0%)[来源: POPE: Learning to Reason on Hard Problems]。
这项研究旨在让 AI 能够坚持不懈地挑战,直到找到正确答案。这不仅超越了单纯提高 AI 智力的范畴,更是一个重要的进步,使我们能够在日常生活中把更复杂、更重要的任务交给 AI。
通俗易懂的解读
为了理解这种学习方法,让我们通过比喻来解释两种核心方式。
第一种是 “NGU(Never Give Up,永不放弃)” 学习法。简单来说,这是一个让 AI 在解决难题时,不轻易放弃,而是不断进行多次尝试的系统 [来源: Learning to Solve Hard Problems in RL for LLMs by Never Giving Up]。 例如,简单的问题尝试一两次就能得到答案,但难题可能需要尝试几十次才能勉强接近答案。NGU 可以帮助 AI 快速处理简单问题,并为难题集中更多的计算资源,直到成功解题 [来源: Learning to Solve Hard Problems in RL for LLMs by Never Giving Up]。
第二种是 “ReGFT(Reference-Guided Fine-Tuning,参考引导式微调)” 方法。这就好比数学老师不直接给出全部答案,而是解出题目 80% 的部分,让学生(AI)根据剩下的部分进行思考 [来源: Learn Hard Problems During RL with Reference Guided Fine-tuning]。AI 根据提供的提示,运用自身的逻辑完成最后的解答,通过这个过程,AI 能够锻炼自身解决难题的“思维肌肉” [来源: How to Explore to Scale RL Training of LLMs on Hard Problems?]。
现状
目前,强化学习在 AI 行业主要活跃于数学问题或编程代码等“正确答案明确”的领域 [来源: How I Learned RL for LLMs]。但随着 NGU 或 ReGFT 等技术的出现,即使在正确答案不那么明确的创意写作或复杂决策问题中,也正在构建一个让 AI 自主学习的环境 [来源: Learning to Solve Hard Problems in RL for LLMs by Never Giving Up]。
不过,AI 为了攻克难题而集中计算资源会导致学习成本增加,这是未来需要解决的课题 [来源: Learning to Solve Hard Problems in RL for LLMs by Never Giving Up]。
未来将会怎样?
未来,AI 不再仅仅是死记硬背数据,而是通过自主制定策略并不断从失败中学习,这种“会思考的 AI”时代将会加速到来。特别是 AI 在最小化人类帮助(提示)的情况下解决高难度问题的能力将得到极大的增强 [来源: Learning to Solve Hard Problems in RL for LLMs by Never Giving Up]。你未来遇到的 AI,可能会比昨天更具韧性,也更具逻辑性。
AI 的视角
MindTickleBytes AI 记者视角:“这表明,对于 AI 而言,‘练习寻找答案的过程’比单纯‘告诉它正确答案’更有价值。人类教育与 AI 学习最终殊途同归。”
参考资料
- Learning to Solve Hard Problems in RL for LLMs by Never Giving Up
- Learning to Solve Hard Problems in RL for LLMs by Never Giving Up (HTML version)
- How to Explore to Scale RL Training of LLMs on Hard Problems?
- Learn Hard Problems During RL with Reference Guided Fine-tuning
- How I Learned RL for LLMs: A Researcher’s Detour in Five Parts
- Learning to Solve Hard Problems in RL for LLMs by Never Giving Up (HuggingFace)
- Learning to Solve Hard Problems in RL for LLMs by Never Giving Up (AlphaXiv)
- POPE: Learning to Reason on Hard Problems
- 重复采样直到得出正确答案
- 由人类输入所有正确答案
- 将模型规模扩大两倍
- 学习成本太低
- 正确答案数据过多
- 从未见过正确结果,缺乏学习信号
- 直接展示完整答案
- 提供部分答案(提示)让 AI 自行完成其余部分
- 强迫 AI 背诵答案