
文章总结与翻译一、文章主要内容本文聚焦推荐系统中的“意外发现性(Serendipity)”评估难题,提出了一种基于大型语言模型(LLMs)的通用离线评估框架,核心内容如下:背景与问题:传统推荐系统易陷入“过滤气泡”,意外发现性(兼具相关性与意外性)可提升用户满意度,但该指标评估面临“无观测真值”“现有离线指标定义模糊或局限于特定数据集/系统”等挑战。框架设计:核心思路:以“LLM作为评估者(LLM-as-a-Judge)”,仅需用户与推荐物品的文本信息,无需依赖模糊定义或特定数据集/系统。两步流程:第一步,通过LLM系统为推荐物品分配1-5级意外发现性评分(1为“完全无意外发现性”,5为“高度意外发现性”,4分及以上视为具有意外发现性);第二步,基于评分量化推荐系统性能(如使用平均评分、精准度Precisionₛₑᵣ、归一化折损累积增益NDCGₛₑᵣ等指标)。实验验证:提示策略筛选实验:在含真值的Serendipity-2018数据集上测试4种提示模板(Base、LS、CoT、LtM),发现“思维链(CoT)”提示的预测准确率最高(GPT-4o-mini模型MAE低于1.0,三分类准确率46.98%)。推荐系统性能评估实验:在ML-1M(电影)、Goodreads(书籍)、Beauty(电商)3个无意外发现性真值的数据集上,评估2个准确率导向(BPR