通过仅使用小学五年级水平教育资料学习的AI模型“小学习者”案例,探讨AI知识范围和学习方式对模型性能的影响。
想象一下。如果你即将面临大学入学考试,但你目前学过的所有内容仅仅达到小学五年级课本水平,会怎样呢?在解答数学题或理解复杂的社会新闻时,你一定会感到非常困惑。但在人工智能(AI)的世界里,情况则有所不同。最近,AI研究领域进行了一项非常有意思的实验。那就是测试一下,如果AI模型从未接触过小学五年级以上的知识,究竟能理解到什么程度。
为什么这很重要?
我们通常认为“AI使用的数据越多越好”。我们相信,必须搜集并学习互联网上的海量信息,AI才会变得聪明。然而,这种方式也带来了AI习得错误信息,或者由于数据过于庞大导致学习效率下降等问题。
如果只教给AI真正必要的关键基础知识,而且是按照非常严谨的教育课程来教,会怎么样呢?这项实验对AI学习的“效率”和“教育方式”提出了新的问题。这是为了寻找答案:我们是应该盲目地让AI变得聪明,还是像对待孩子一样,一步一个脚印地积累正确的知识。
轻松理解
在此次研究中作为主角登场的模型是“小学习者(LittleLearner)”。由Fanfei Li研究团队发表的该模型拥有约50亿个参数(Parameter,即AI在记忆信息和进行判断时使用的核心调节数值)。研究人员从零开始训练了拥有50亿个参数的“小学习者”模型。
但该模型学习的材料非常特别。它仅使用了从幼儿园到小学五年级的教育资料。“小学习者”仅通过小学五年级以下水平的教育资料进行了学习。
打个比方,如果巨大的AI模型是读遍全世界图书馆的“知识探险家”,那么“小学习者”就是经历了非常系统的小学教育课程的“小学霸”。它的特点在于,虽然没有读过图书馆里的所有书,但已经稳扎稳打地掌握了作为基础的语法、基础科学、历史等核心原理。
当前状况
目前人工智能技术虽然在飞速发展,但依然未能摆脱“幻觉(Hallucination,指AI将与事实不符的信息说得像真的一样)”或数据偏见等问题。在不加甄别地学习互联网数据的过程中,AI会出现说谎或犯错的情况,实际上也有研究表明,通过分析AI模型的内部状态,可以感知到AI是否在撒谎。
在这种情况下,像“小学习者”这样的实验唤醒了我们对“纯净数据”重要性的认识。因为它成为了一个重要的指标,能够让我们确认比起盲目追逐过于困难的专业知识,完美掌握基础知识会对AI的性能产生何种积极影响。
未来会怎样?
未来的AI开发方向不仅是制造更大、更重的模型,还将专注于如何更好地教育像“小学习者”这样小巧且高效的模型。在开发AI模型时,精确的数据搜集与筛选、伦理考量以及模型的详细调整是必不可少的过程。
我们很快就会在日常生活中频繁见到那些专注于特定领域,或经过严谨教育课程、更加值得信赖的小型AI模型。智能手机里的助手比现在更具逻辑、说话更准确的未来,其第一步就蕴含在这项“接受过小学教育的AI”实验中。
MindTickleBytes AI记者视角
知识的“质量”胜过“数量”,这一真理不仅适用于人类。AI只有在正确的基础之上成长,才能成为我们真正可以信任并托付的得力助手。
参考资料
- 互联网上的所有资料
- 小学五年级水平以下的教育资料
- 大学水平的论文资料
- 3000万个
- 50亿个
- 1.5万亿个
- 因为数据数量必须无条件地多
- 因为数据直接影响模型的性能和理解能力
- 因为AI无法自主学习