Fiction.liveBench 测试集档案
Fiction.liveBench 测试集中文档案:让 AI 读完十几万字小说再考细节 由 社区评测者「kas」,fiction.live 平台,2025-04 首发 组织,包含测试方法、典型任务、分数解读、沿革与局限。
- Fiction.liveBench
- Fiction.liveBench(Scout · 128K)
- 社区评测者「kas」,fiction.live 平台,2025-04 首发
已发布事实
- 规模
- 约 30 篇故事、36 道深度理解题
- 长度
- 最长 120k+ token,按上下文长度分档报告
- 对照设计
- 每篇母故事配多个保留关键细节的缩短版,精确测衰减
- 考察点
- 角色心智、事件时间线、从暗示信息推断——非检索式
- 运营方
- 社区评测者 kas,发布在 fiction.live 连载平台
它测什么
用长篇小说考「真读懂」的社区长文本基准:约 30 篇故事、36 道深度理解题,文本长度拉到 12 万 token 以上。它和「大海捞针」类测试的本质区别在于问题不是找一句话,而是要具备对角色的心理揣摩(心智理论)、事件时间线的梳理、以及从字里行间的暗示做推断的能力。每篇母故事还有多个保留关键细节但更短的版本,用来精确测量同一个模型在文本变长时理解力衰减多少。
怎么测
把整篇小说塞进上下文,然后问关于情节和人物的问题,按问答准确率计分,并按上下文长度分档报告。衰减曲线是核心看点:同一批题,4K、32K、128K 各跑一遍,画出准确率随长度下滑的轨迹。
分数怎么看
首批评测显示多数模型随文本变长明显掉分,Gemini 2.5 Pro 在 120k token 档表现最稳(社区报告口径)。读这个榜要看曲线而不是单点:短文本满分、长文本腰斩是常态,128K 档的分数才是「长文理解」的真实成色。
局限
这是个人运营(kas)的社区榜单,不是学术机构基准:题目少(36 题)、无论文级评审,统计噪声和题目主观性都需注意。故事来自 fiction.live 公开创作平台,较新故事污染风险低但并非零。不过它已被学术综述(arXiv:2512.00193)引用,是社区长文本榜里认可度较高的一个。
典型任务
题目的典型形态:一篇十几万字的多视角小说里,问「某个角色第二次见到另一角色时,他误以为对方是谁」——答案不会出现在任何一句话里,需要跨章节拼出事件顺序、并理解角色当时的认知局限。再比如问某条暗线伏笔最终如何回收,必须把开头埋的暗示和结尾的揭示对上号,检索式阅读答不出来。
沿革
- 2025-03-25:fiction.live 上可追溯的最早版本(Mar 25 2025 帖)
- 2025-04-06:数据版被第三方可视化项目(llms-long-context-benchmark)引用传播
- 2025-04-29:April 29 2025 版发布,即本站主链接版本
- 2025-05-22:May 22 2025 版更新,持续滚动换题
- 2025-12:被长上下文学术综述(arXiv:2512.00193)引用,进入学术视野