Evaluating Cultural Knowledge Processing in Large Language Models: A Cognitive Benchmarking Frame...

发布时间:2026/7/23 20:46:40
Evaluating Cultural Knowledge Processing in Large Language Models: A Cognitive Benchmarking Frame... 文章主要内容与创新点总结一、主要内容该研究聚焦大型语言模型(LLMs)对少数族裔文化知识(以台湾客家文化为例)的处理能力,提出了一种融合布鲁姆分类法(Bloom’s Taxonomy)与检索增强生成(RAG)的认知基准框架,用于系统评估LLMs在记忆、理解、应用、分析、评价和创造六个认知维度的表现。研究构建了包含10,158道多选择题的客家文化基准数据集,选取GPT-4.1-mini、Gemini-2.5-flash、Llama-4-maverick等模型,分别在闭卷(仅依赖内部知识)和开卷(结合RAG调用外部客家文化知识库)条件下进行测试。结果表明:RAG增强型模型在记忆、理解、分析等中低阶认知任务中表现显著优于基准模型,有效提升了事实准确性、语境相关性和语义精度,缓解了少数族裔文化数据集知识稀疏导致的问题;所有模型(包括RAG增强型)在“创造”这一高阶认知任务中仍存在局限,难以实现具有文化细微差别的生成式综合;Gemini-2.5(RAG)整体表现最佳,GPT-4.1(RAG)在成本效率与性能间达到较好平衡。研究还通过误差分析识别了模型的三类核心问题:内容错误、推理缺口和创造力不足,并为文化AI系统的优化提供了方向。二、创新点提出了首个融合认知领域基准(布鲁姆分类法)与RAG技术的文化知识处理评估框架,实现了对LLMs文化认知能力的多维度、层级化测评,兼具结构性与可复制性;构建了专门针对台湾客家文化的大规模基准数据集,涵盖22个主题