BENCHMARK / RECORDED RESULT

LongMemEval 已记录成绩:82.2%。

500 道题中答对 411 道,所有任务分项成绩如下。

01 / 分项成绩

总分之外,也完整展示各类任务表现。

所有条形图使用同一零点,并始终显示精确数值,不让图形代替结果本身。

知识更新71 / 78
91.03%
跨会话综合90 / 133
67.67%
单会话 · 助手信息55 / 56
98.21%
单会话 · 偏好记忆27 / 30
90.00%
单会话 · 用户信息67 / 70
95.71%
时间推理101 / 133
75.94%

02 / LOCOMO

Mem0 风格 LLM Judge 协议成绩:80.92%。

这是一项辅助指标,覆盖 Category 1–4,并取五次运行均值;全量 1,986 道题的确定性指标单独列出。

MEM0-STYLE LLM JUDGE80.92%

辅助指标 · Category 1–4 · N = 1,540 · 五次运行均值

OFFICIAL TOKEN F155.20

确定性评分器 · 全部 1,986 道题

EVIDENCE RECALL82.00%

证据召回覆盖 · 全部 1,986 道题

80.92% 的 Judge 成绩不包含 Category 5,也不作为全量官方准确率展示。

03 / 已记录召回

核心召回链路已记录用时:1.322 秒。

这项数据表示什么

这是项目实测召回链路中的一项已记录结果。

这项数据不表示什么

它不是实时状态,也不代表所有部署与请求的可用性或延迟 SLA。

网站如何展示

网站以静态、明确标注的方式展示,不把它包装成持续更新的遥测数据。

04 / 复现

按照仓库说明运行并复现 Benchmark。

公开仓库提供架构说明、任务分项和复现入口。

GitHub ↗