从单条事实检索到人格特质推断:个性化Agent分层理解基准Setoka详解

Setoka: A Benchmark for Hierarchical User Understanding in Personalized Agents over Heterogeneous Data

论文原文 ↗ 论文发布 解读发布 解读:AI前沿分享

从单条事实检索到人格特质推断:个性化Agent分层理解基准Setoka详解 论文图示

今天的个性化智能体(Personalized Agent)在面对用户时,究竟是在“真正理解一个人”,还是仅仅扮演了一个具备关键词查找功能的本地数据库?当用户询问“我上次订的酒店退款了吗”,系统只需要从某条聊天记录或邮件中提取单点事实;但如果用户希望智能体像一个真正的私人助理那样,在安排日程时主动避开其抗拒的高社交负荷场景,或在关键决策时契合其深层偏好,单纯的事实检索就会彻底失效。这类抽象的用户画像往往不会以“我很内向”或“我有拖延习惯”这种直白字句写在任何一条记录里,而是高度弥散在短信、日历、社交图谱、消费账单等跨模态、跨时间的异构数据中。

ArXiv URL:https://arxiv.org/abs/2607.27056v1

华东师范大学与香港中文大学的研究团队提出了专门针对记忆增强个性化智能体的评测基准 Setoka。这项工作直击现有记忆基准(如 LongMemEval、LoCoMo 等)的盲区:过去的研究过度关注单轮或多轮长文本对话中的显式事实提取,无法评测系统跨越不同数据源、提炼高阶抽象特征的推理能力。Setoka 扎根于认知与人格心理学理论,首次形式化提出了从具体记忆到抽象特质的“四层用户理解框架”(语义记忆、情境记忆、行为模式、人格特质)。同时,为了解决真实隐私泄露与数据合成失真的矛盾,团队设计了一套基于心理测量学的可控数据生成管线,合成出覆盖 23 种数据模式、跨越两个月活动跨度的长程异构记录。

评测结果揭示了一个残酷的现状:主流记忆系统与大语言模型在最底层的单条记录查询上尚可应付,但随着抽象层级上升,系统性能呈现单调递减;在行为模式统计与人格特质推断等高阶任务中,现有系统的推断结果甚至仅仅略高于随机猜测。这一发现表明,单纯堆砌向量检索或上下文窗口,根本无法弥合从“原始数据抓取”到“深层用户洞察”之间的鸿沟。

Setoka 架构概览

为什么现有记忆评测测不出“深层理解”?

大语言模型驱动的 Agent 正在接管越来越多的个人事务管理工作,但评估这类 Agent 的记忆机制一直存在严重的评测偏移。回顾近年来的代表性记忆基准,无论是关注超长会话跨度事实召回的 LongMemEval,还是追踪跨会话画像演变的 PersonaMem,其核心任务范式本质上都是文本序列层面的“大海捞针”。在这类任务中,关键证据通常是一句显式的声明,例如“我周末喜欢去徒步”或“我换了新的电话号码”。智能体只要在向量数据库中命中对应的文本切片,再交由大模型完成信息抽取,即可获得极高的评测得分。

然而,真实的个性化体验绝非简单的单点事实回传。一个人的生活痕迹往往以高度异构的形式散落在不同数字系统中。日程表记录了具体的时间与事件,通讯录描绘了社交图谱的拓扑结构,备忘录与即时通讯记录承载着非结构化的对话碎片,账单记录则记录了结构化的消费流向。以大五人格理论中的“外向性”(Extraversion)为例,一个高外向性的个体通常不会直接向 Agent 发送一段自我介绍,而是表现为日历上密集的群组活动、通讯软件中活跃的多人会话,以及社交网络中高密度的连接关系。

要推断出这一特质,Agent 必须完成跨数据模态的关联定位、时间维度的模式聚合,以及从行为表现向心理学潜变量的逻辑跃迁。现有的单一会话日志型基准不仅在数据结构上过于扁平单一,更缺乏对不同认知推理深度的解耦评估。如果评测工具只能给出综合准确率,研究者便无法确认模型究竟是倒在多源数据对齐的第一步,还是缺乏从长期离散行为中提炼概率分布的归纳能力。

心理学筑基:四层递进的用户理解模型

为了使评估具有严谨的理论支撑与清晰的推理边界,Setoka 借鉴认知心理学与人格心理学的经典构念,将用户理解划分为四个严格递进的层级。每个层级对应着证据范围的逐级扩大,以及在底层推理操作上的叠加嵌套。

第一层为语义记忆(Semantic Memory, SM)。该层级对应孤立事实的直接抽取,其数学操作抽象为单条记录的选择算子 $\sigma$。例如询问“用户在某天登记的紧急联系人是谁”,答案完全闭合在某一张特定通讯录卡片或结构化表格内。模型无需关联外部上下文,仅靠精准的键值查找或单文档定位即可完成。

第二层为情境记忆(Episodic Memory, EM)。情境记忆关注具体事件在时间、空间与多实体间的完整还原,其操作为链接算子 $\lambda$ 与选择算子 $\sigma$ 的复合。现实生活中的一个事件通常由多个系统协同记录:一次下午的跨部门会议,在日历中对应日程安排,在通讯录中对应参会人属性,在聊天记录中对应讨论细节。情境记忆评测要求系统利用部分线索(如时间与地点)检索并链接同属于该事件的所有异构记录,从而找回缺失的关键细节。

第三层为行为模式(Behavior Pattern, BP)。当时间跨度拉长,重复发生的情境记忆会固化为个体的习惯与常规反应。行为模式的推理依赖于聚合算子 $\gamma$。系统需要跨越较长的时间轴(例如数周或数月),对特定类别的全部事件进行统计抽象,回答诸如“用户在周末与某位好友联络的通常频次”或“用户在加班后的消费偏好变动”。此时,任何单次事件都不足以支撑最终结论,模型必须具备全局时间范围内的统计汇总与模式归纳能力。

第四层为人格特质(Personality Trait, PT)。这是最抽象的潜变量推理层,操作体现为高阶映射算子 $\rho$。人格特质深植于长期演化出的全部行为模式之中。由于人格特质在任何底层数据中均无直接文字表述,且不同个体可能在不同场景下表现出异质的行为表达,系统必须综合考量多个领域的长期行为模式,完成相对水平的排序或推断。四层体系构成了严密的证据闭包,从单条记录延伸至全域历史,使评测不仅能定位“答错与否”,更可精确剖析“模型思维断裂在哪一层”。

Setoka 基于心理测量学的数据生成流程

消除刻板印象:基于心理测量学的合成管线

构建一个同时包含深层特质与微观记录的基准数据集,面临着真实隐私风险与逻辑一致性的双重挑战。直接采集真实用户的跨软件私有数据在伦理上极度敏感,而让大模型直接凭空编写长期用户日志,又极易陷入上下文漂移、前后矛盾或产生严重的刻板印象。例如,直接提示大模型生成一个“高尽责性”的人,模型往往会生成千篇一律的极端作息表,抹杀了心理学上已被反复验证的个体间异质性。

Setoka 设计了一套自顶向下的心理测量学合成管线,将生成流程拆解为四个严格受控的阶段,确保从底层数据到顶层人格之间具备数学上可追溯的因果链条。

首先是相关性感知的特质采样。在真实人群中,大五人格各维度之间并非相互独立,而是存在稳定的元分析相关性(例如外向性与神经质往往呈负相关)。为了避免采样出荒谬的特质组合,研究团队基于大五人格的元分析协方差矩阵构建多变量高斯分布,从中联合采样五维特质向量。这确保了生成的虚拟用户在统计分布上高度贴近真实人类群体的性格结构。

其次是心理量表引导的行为模式映射。同一项人格特质在不同生活场景中具有多样化的行为投射。为摆脱大模型自发生成的扁平刻板印象,管线引入了在心理学界经过充分验证的 BFI-2 量表(包含 60 个测量项目)。系统将采样的特质向量转化为对具体量表题目的打分反应,再基于量表条目派生出细粒度的行为模式与发生频次。由于多种不同的量表打分组合可以映射到相同的人格总分,这种设计在保持特质保真度的同时,赋予了虚拟用户极大的行为丰富度。

随后是基于事件树的生成与异构实例化。如何将抽象的行为频率落地为连续两个月、逻辑自洽的时间线?直接让大模型按天顺次书写极易发生早期约束丢失。Setoka 提出了粗细粒度结合的“事件生成树”:高层节点规定长期背景与大尺度行为约束,底层节点则以自回归方式生成具体的日程事件。在同层兄弟节点间维护叙事连贯性,而在展开事件细节时则采用并行生成以控制上下文膨胀。最后,管线将每一个确定的事件作为“单一事实源”(Single Source of Truth),按照预定义的 23 类 Schema,衍生出对应的关系型数据(日历、消费)、图数据(社交网络邻接表)以及半结构化与文本数据(即时通信、个人备忘)。所有的异构记录均严格溯源至底层事件,从而杜绝了不同数据源之间的逻辑冲突。

基于 DeepSeek-V4-Pro 作为生成底座,Setoka 实例化了 10 位虚拟用户的完整数字生活史。每位用户均具备完整的人格向量、11 项核心行为模式、跨越两个月的真实日程,由大约 1600 条异构记录(约 364K Token)组成。在此基础上,系统自动生成了 1426 道四层评测问题,并自带基于生成元数据的精准证据链。

实验与洞察:记忆系统的多层能力退化

基于 Setoka 基准,研究团队对 3 种主流开源大语言模型(DeepSeek-V4-Flash、Ministral 3 14B Instruct、Gemma 3 4B-IT)与 5 种前沿记忆系统(MemGPT、Mem0、Cognee、HippoRAG 2、MemMachine)及 SQL 检索基线展开了系统性评测。在评测指标上,前三个层级(SM、EM、BP)结合生成内容与参考答案,通过大模型评审计算语义相似度;对于最高层的人格特质(PT),由于特质属于隐变量且无法用绝对数值衡量,评估采用肯德尔秩相关系数(Kendall’s $\tau$),衡量系统对全部用户在各特质维度上排序结果与真实标签的吻合程度。

评测结果清晰地展现了随着理解层级攀升,现有系统能力的系统性溃败。在最基础的语义记忆(SM)层级,结合直接数据库查询或精准键值检索的方案能够取得相当高的得分,部分配置的分数超过 80 分。这一现象印证了当前工业界与学术界的普遍认知:对于明确给出的单点属性,只要检索路由正确,大模型凭借强大的上下文信息抽取能力能够较为稳定地完成任务。

然而,一旦跨入情境记忆(EM),所有系统的表现均出现了明显的下滑。以开源图谱记忆系统 Cognee 和基于海马体索引机制的 HippoRAG 2 为例,它们在多跳关系和结构化关联上具备理论优势,但在面对跨模态(例如根据一条模糊的聊天提及去匹配特定日历事件,再反推参会人的公司属性)时,多源信息的对齐损耗非常严重。系统经常能够检索出其中一个维度的切片,却在合并多源实体时发生关键属性遗失或错误嫁接。

更显著的技术断层发生在行为模式(BP)与人格特质(PT)层级。面对行为模式查询,智能体需要扫描数周的历史、辨识周期性规律并统计发生概率。现有的外挂记忆系统大多依赖 Top-$k$ 语义相似度召回切片,这种机制天生与“全量时间序列统计”相抵触。向量检索往往只能召回与提问语义最接近的几条典型记录,大模型随后基于这几条孤立样本进行严重偏颇的局域概括,导致统计数值与真实频率大相径庭。在行为模式层级,多数记忆增强系统的表现甚至大幅落后于全量上下文暴力输入的简单基准。

在最高维度的人格特质推断中,各家记忆系统与大模型的组合遭遇了近乎灾难性的失效。评测所得的肯德尔秩相关系数绝大多数在 0.1 左右徘徊,部分组合甚至出现了负相关。这意味着,当面对两个月的完整数字化痕迹时,现有智能体推断出的用户性格画像与随机抛硬币排序相差无几。即便为大模型挂载了复杂的记忆整合逻辑,模型依然无法在脑海中建立起从“散发出的碎片行为”逆向求解“心理学潜变量”的严密推理路径。

答复率与能力的错位:小模型的虚妄自信

在深入分析各模型在不同层级的表现差异时,实验揭示了一个极具实践启示的现象:系统的高答复率并不等同于其实际掌握了知识,往往反而折射出校准能力的缺失。

在基准评测中,针对每个问题,模型既可以选择给出明确推断,也可以在证据不足时选择弃权拒答。统计数据显示,从语义记忆到人格特质,系统的平均答复率反而从 72% 一路攀升至 93%。其背后的逻辑显而易见:当面对具体的语义事实问题(如“某日会议是在哪个会议室召开”)时,如果检索模块未能命中对应的日志片段,模型往往能够清醒地意识到信息缺失,从而选择弃权;但当面对宽泛的人格特征或行为倾向问题时,由于抽象概念本身的语义外延极其模糊,大模型几乎总是可以根据残留的零星偏见或模板化措辞给出一份看似合情合理、实则全凭瞎猜的输出。

这种“过度自信”在小参数量模型上表现得尤为剧烈。在横向对比中,轻量级的 Gemma 3 4B-IT 在全层级任务中给出了高达 71% 至 100% 的答复率,几乎从不主动拒答,但在实际的推断准确率与相关性得分上,它在所有受试模型中垫底。相反,参数规模更大、推理调优更为充分的 DeepSeek-V4-Flash 与 Ministral 3 14B 则展现出更优秀的不确定性校准意识:在检索证据匮乏时更倾向于克制输出,而在确定回答时则具备更高的命中质量。这一实验细节强有力地提示社区:在未来个性化 Agent 的评测体系中,单纯考察答案覆盖面极度危险,必须将“证据不足时的弃权能力”作为核心校准指标独立量化。

从被动检索走向主动抽象的记忆演进

Setoka 的提出,为大模型个性化助理的研发确立了一把全新的标尺。它所揭示的核心问题在于:目前流行的“分块-向量化-相似度召回”的 RAG 式记忆范式,根本无法承载真正的个性化智能。

真正的用户理解不是在用户发问那一刻仓促地进行全文扫描或语义拼凑,而是在长期的人机交互与多源数据涌入过程中,持续在后台进行离线的信息提炼、事件对齐与模式演化。当一条日历、一条聊天记录被写入系统时,一个优秀的个性化 Agent 应当在记忆中完成多层递进处理:先在底层将散碎记录聚拢为确定性的情境事件;随后沿时间轴动态维护高频的行为画像统计算子;最终在顶层形成具备弹性的用户心理与性格特质表征。当这种自底向上的分层记忆网络真正搭建起来后,高层的特质推断便不再是一次无源之水的“大模型幻觉推理”,而是一个可解释、可追溯且具备坚实统计支撑的归纳过程。

从这个意义上说,Setoka 不仅是一个评测基准,更为下一代记忆系统的设计指明了架构演进的必然方向。未来的个性化智能体如果要真正跨越“工具”到“助理”的门槛,必须尽早跳出将“记忆”等同于“对话历史检索器”的狭隘认知,迈向面向异构物理世界的跨源整合与自发抽象。