尽管大型语言模型在文本分析方面表现出色,但在处理表格数据时,由于对数据顺序结构的错误偏向以及复杂数值解析的局限性,其性能往往不如传统的数据分析方法。
想象一下:你在公司里手里拿着一份包含数万行销售数据的Excel文件。你问当今世上最聪明的AI:“请帮我分析一下这张整理了每月按产品划分的销售人员、销售时间和销售金额的‘表格’。”然而,AI却答非所问:“嗯,这份数据读起来就像一个普通的故事。”为什么理应精准计算数字的AI会犯这种错误?
近来,大型语言模型(Large Language Models, LLM,通过学习海量文本像人类一样对话的AI)在总结我们撰写的文章、分析晦涩的论文或编写复杂的编程代码方面展现出了惊人的能力。但令人惊讶的是,在分析Excel或数据库等“表格数据(Tabular Data)”时,它们的表现反而不如十年前就开始使用的传统统计方法 参考资料 10, 参考资料 11。
为什么这很重要?
在现代商业和研究领域,大多数核心数据都以表格形式存在。财务报告、客户购买记录、临床试验结果等,所有重要决策都是通过这些数字表格做出的。如果最先进的AI无法正确理解这些核心数据,企业将不得不继续依赖过时的分析工具,无法完全享受最新AI技术带来的红利。要实现我们所期待的“智能助手”形象,AI必须跨越“数字数据分析”这道墙。
简单来说:AI把表格当成“句子”来读
我用一个比喻来解释为什么AI处理表格数据表现不佳。
“Transformer(AI的核心结构,通过捕捉句子中单词间的关系来提取意义)”这项技术最初是为“语言”而生的。简而言之,AI在训练时被要求寻找阅读文本时从左到右流动的“故事脉络”。
然而,当遇到表格数据时,AI就像阅读外文小说一样,强行将表格转换为文本(序列化)来进行读取 参考资料 9:“第1行第1列是销售额,第1行第2列是产品……”诸如此类。
问题就在这里。表格并不是一个“故事”。表格是一个行与列相互独立,或以极其复杂方式连接的二维空间。AI本能地试图读取具有顺序的句子,但表格却是与顺序无关的多维信息集合。这就像明明看着地图找路,却只看地图上按顺序排列的地名文字来判断位置一样 参考资料 9。
此外,AI在分析数据时,虽然对加法等基础算术运算很熟悉,但在自主生成实际数据分析中至关重要的“分组与聚合(grouping and aggregations)”等复杂逻辑方面却显得力不从心 参考资料 3, 参考资料 8。换句话说,人类在Excel中制作透视表级别的逻辑分析,AI尚未“学会”。
现状如何:AI靠“察言观色”来分析
目前许多AI模型在深度理解数据本身之前,往往过度依赖表格中列的名称(标识符) 参考资料 12。例如,看到列名为“Sales_Amount”,AI就会“察言观色”得出“啊,这是销售额”。但如果将这个名称改成“col_01”这种无意义的字符,AI的性能就会急剧下降 参考资料 12。也就是说,它并非在深度解析实际数据值,仅仅是看着人类贴上的标签(元数据)在猜测 参考资料 6。
由于这种局限性,在实际应用中,基于决策树(Decision Tree)的传统机器学习方法在分析表格数据时依然表现得更快、更准确 参考资料 11。
未来方向:成为真正的数据分析师
未来,针对不仅擅长文本,还能理解表格结构本身的“数据语言模型”研究将会非常活跃 参考资料 6。当我们在看表格数据时问它:“这里卖得最好的产品是什么?”的那一天终将到来——那时AI不再是靠看标签“察言观色”,而是能准确认知表格结构,通过数学计算进行汇总并给出回答。
但就目前而言,比起将重要的经营数字分析完全交给AI,我们更有必要将其作为文本摘要或代码生成等领域的辅助工具,展现出应有的智慧。
MindTickleBytes的AI记者视角
语言模型是通过文本来学习世界知识的,因此它将充满数字的表格视为一种“陌生语言”。然而,一旦AI学会将数学逻辑与语言洞察力相结合,我们的工作效率将以不同维度的速度得到提升。在那之前,请把AI仅仅当作你的“天才助手”来使用吧。
参考资料
- [Source 3] Large Language Models Engineer Too Many Simple Features for Tabular Data (https://arxiv.org/html/2410.17787v1)
- [Source 6] Large Language Models(LLMs) on Tabular Data: Prediction, Generation, and Understanding – A Survey (https://arxiv.org/abs/2402.17944)
- [Source 8] Large Language Models Engineer Too Many Simple Features for Tabular Data (https://arxiv.org/html/2410.17787v2)
- [Source 9] The Illusion of Generalization in Tabular Language Models (https://arxiv.org/html/2602.04031v2)
- [Source 10] Small Models are LLM Knowledge Triggers for Medical Tabular Prediction (https://arxiv.org/html/2403.01570v3)
- [Source 11] Language Models Are Good Tabular Learners (https://openreview.net/forum?id=r8tMECbxOl)
- [Source 12] Data Language Models: A New Foundation Model Class for Tabular Data (https://arxiv.org/html/2605.06290v1)
- 能够完美理解所有数值,但处理速度慢
- 在将表格数据转换为顺序文本的过程中误解了数据的本质结构
- 无法读取表格数据,必须转换为图像才能处理
- 倾向于仅使用加法等简单运算,无法有效利用分组或聚合等复杂运算
- 执行的运算过于复杂,不适合常规数据
- 由于数据安全规定,无法执行复杂运算
- 数据量太小时
- 数据中包含人名时
- 列(column)的标识符(名称)被删除或更改为无意义字符时