我们介绍了一种新的范式:不再将LLM仅仅视为数据分类的终点,而是将其作为一种“特征工程”工具,通过结构化复杂的非结构化数据来最大化预测模型的性能。
想象一下。您的办公桌上堆积着数万份客户咨询日志。要一一阅读并掌握内容简直令人望而却步。过去,我们通常会命令AI“请帮我分类这些咨询的内容”,然后只获取最终结果。但最近在AI领域,人们开始将这个过程视为一种让数据变得更有价值的“烹饪”,而非单纯的“分类”。
这不仅仅是信任AI给出的结果,而是利用AI感知上下文的细腻能力,将其作为一种能够将数据打磨得更适合使用的“特征工程(Feature Engineering)”工具。在这里,特征工程是指将数据加工成机器学习模型易于理解的核心信息的过程。
为什么这很重要?
到目前为止,对于我们而言,大语言模型(LLM)一直是一个回答问题或撰写文章的智能秘书。但在实际工作现场,相比于这个秘书给出的答案,其为了得出答案而使用的“知识”本身,往往具有更大的价值。
| 如果仅将AI用作分类器,当AI给出错误答案时,我们往往束手无策;但将其用作数据加工者,情况则完全不同。基于AI提取的结构化信息,运行现有的传统机器学习模型(例如 XGBoost),预测准确度会大幅提升。也就是说,AI现在不再是预测的主角,而是成为了让预测变得更准确的最强“助手” [出处: LLM Classification Is Feature Engineering | Minimally Sufficient](https://minimallysufficient.com/posts/llm-classification-is-feature-extraction/) 出处: Stop Labeling, Start Engineering: The New Era of LLM …。 |
轻松理解:AI是一位出色的翻译家
“特征工程”这个词听起来很难吗?打个比方,AI是一位非常出色的“翻译家”。想象一下,您需要阅读非常复杂且杂乱的外语文档,并整理核心内容表格。
- 传统方式(分类):命令AI“告诉我这份文档是积极的还是消极的”,然后贴上“积极”这样一个标签。剩下的丰富信息全被丢弃了。
- 新方式(特征工程):将AI用作智能翻译家。AI阅读文档,提取出“这位客户对配送速度不满,对价格满意,并有复购意向”这样的核心信息。然后,将其整理成“配送满意度”、“价格评分”等项目。
| 这样整理出来的信息,变成了计算机最易于理解的形态。 [出处: Feature engineering from LLM outputs | Xgboost Advanced Course | The Neural Base](https://theneuralbase.com/xgboost/learn/advanced/feature-engineering-from-llm-outputs/)。在此过程中,AI为得出分类结论而使用的逻辑推理过程本身,就成了数据的核心特征(Feature) 出处: Stop Labeling, Start Engineering: The New Era of LLM …。 |
现状:进展如何?
相关技术已经活跃地应用于现场。
- 自动化特征发现:像 FeatLLM 或 LLM-FE 这样的框架,利用AI的知识和推理能力,自动发现人类难以逐一寻找的数据特征 出处: Large Language Models Can Automatically Engineer Features for … 出处: LLM-FE: Automated Feature Engineering for Tabular Data with …。
-
性能的飞跃性提升:研究结果显示,当利用基于LLM的数据加工时,传统机器学习模型的性能得到了压倒性的改善。一项研究显示,在19个数据集中,该方法以最低的排名(1.47)证明了其最佳性能 出处: LLM-FE: Automated Feature Engineering for Tabular Data with LLMs as Evolutionary Optimizers [Quick Review]。甚至在复杂的分类任务中,将预测误差指标——布莱尔分数(Brier Score)从0.26降低到0.13,减少了近一半 [出处: LLM Classifiers: Cut Brier Score 0.26 to 0.13 explainx.ai …](https://www.explainx.ai/blog/llm-classification-feature-engineering-calibration-2026)。 - 便捷的访问:现在是一个无需从零开始重新训练模型(Fine-tuning),只需通过精心设计的提示词(指令)就能执行此类高级工作的时代 出处: How to UseLLMforClassification。
未来将会如何?
未来,比起直接构建AI模型,“使用哪种AI作为数据加工者”以及“如何向AI提问使其更好地理解数据”,将成为工程师最重要的能力。像 FeRG-LLM 那样通过推理结果创建特征的方式(FeRG-LLM展示了比现有大型模型更高效、更卓越的性能)预计将成为主流 出处: FeRG-LLM : Feature Engineering by Reason Generation Large Language Models [Quick Review]。
数据现在不再是原石本身,通过AI这一精细工具将其打磨成宝石的过程,将成为必经之路。
MindTickleBytes 的 AI 记者视角
LLM 不是得出正确答案的“考试机器”,而是辨别何为重要的“显微镜”。我们不应满足于AI的答案,而应借用AI寻找答案的“眼睛”,让我们的数据变得更有价值。
参考资料
-
[LLM Classification Is Feature Engineering Minimally Sufficient](https://minimallysufficient.com/posts/llm-classification-is-feature-extraction/) - Stop Labeling, Start Engineering: The New Era of LLM …
-
[LLM Classifiers: Cut Brier Score 0.26 to 0.13 explainx.ai …](https://www.explainx.ai/blog/llm-classification-feature-engineering-calibration-2026) - Large Language Models Can Automatically Engineer Features for …
- LLM-FE: Automated Feature Engineering for Tabular Data with …
- LLM-FE: Automated Feature Engineering for Tabular Data with LLMs as Evolutionary Optimizers [Quick Review]
-
[Feature engineering from LLM outputs Xgboost Advanced Course The Neural Base](https://theneuralbase.com/xgboost/learn/advanced/feature-engineering-from-llm-outputs/) - FeRG-LLM : Feature Engineering by Reason Generation Large Language Models [Quick Review]
- How to UseLLMforClassification
- 模型的大小
- 用于分类数据的最终标签
- LLM为了分类数据而使用的推理过程
- 无需人类干预的自动化特征发现
- LLM模型大小的缩减
- 降低数据标注成本
- 不再需要机器学习模型
- 提高预测模型的可解释性和准确性
- 彻底废除数据清洗过程