()
| 25 | |
| 26 | |
| 27 | def _valid_note_text() -> str: |
| 28 | return """# Paper |
| 29 | |
| 30 | ## 核心信息 |
| 31 | |
| 32 | - 标题: Paper |
| 33 | - 发表时间: 2024 |
| 34 | - DOI: 10.1234/example |
| 35 | |
| 36 | ## 原文摘要翻译 |
| 37 | |
| 38 | 论文围绕长链路推理中的错误传播问题,提出一种把检索证据、工具调用状态和最终答案联合建模的框架,并报告了主要实验结论。 |
| 39 | |
| 40 | ## 创新点 |
| 41 | |
| 42 | - 论文把检索证据选择和工具调用规划放在同一个状态转移过程里建模,使错误证据不会在后续步骤中被默认当成可靠输入。 |
| 43 | - 论文设计了失败调用回溯机制,显式记录每一步工具返回的置信度和异常类型,从而让最终答案能区分证据不足和模型推理错误。 |
| 44 | |
| 45 | ## 一句话总结 |
| 46 | |
| 47 | 这篇论文用可审计的工具调用状态机降低长链路问答中的错误累积。 |
| 48 | |
| 49 | ## 研究问题 |
| 50 | |
| 51 | 论文关注多步问答系统在检索证据不完整、工具调用失败和中间状态被误用时,如何保持最终答案的可追溯性与可靠性。 |
| 52 | |
| 53 | ## 数据与任务定义 |
| 54 | |
| 55 | 任务输入包括用户问题、候选检索证据和可调用工具列表;输出包括最终答案、每一步工具调用记录以及失败原因标注。 |
| 56 | |
| 57 | ## 方法主线 |
| 58 | |
| 59 | ### 机制流程 |
| 60 | |
| 61 | 输入问题先进入证据筛选模块,随后工具规划器选择下一步调用,最后由答案生成器结合状态日志输出可追溯结论。 |
| 62 | |
| 63 | > [!figure] 图一 方法概览 |
| 64 | > 建议位置:方法主线 |
| 65 | > 放置原因:帮助理解整体过程。 |
| 66 | > 当前状态:保留占位;未找到高置信度整图。 |
| 67 | |
| 68 | ## 关键结果 |
| 69 | |
| 70 | 在三个多步问答数据集上,方法把答案准确率从 71.2% 提升到 78.5%,并将不可追溯错误比例从 18% 降到 9%。 |
| 71 | |
| 72 | ## 深度分析 |
| 73 | |
| 74 | 这项工作的关键价值不只是提升最终分数,而是把失败工具调用从隐藏中间状态变成可检查证据,因此适合需要审计链路的知识密集型问答。 |
| 75 | |
| 76 | ## 局限 |
| 77 | |
| 78 | 论文主要在英文问答数据上验证,工具集合也集中在检索和计算两类,尚未证明该状态机能稳定覆盖多模态工具或高延迟外部服务。 |
| 79 | |
| 80 | ## 我的笔记 |
| 81 | |
| 82 | 我会重点关注它的失败回溯机制是否能迁移到论文精读流程,因为 DeepPaperNote 同样需要区分证据缺失和模型总结不足。 |
| 83 | |
| 84 | ## 引用 |
no outgoing calls
no test coverage detected