问题
长篇课件和图文混排材料用一次性提示词很容易断上下文。产品问题不是生成一段答案,而是保留上下文、决定何时调用工具,并让执行路径可检查。
工作流
- 01将文档预处理、版面分析、局部检索、页面解释和质量评分拆成节点。
- 02用 LangGraph Planner / Reasoner 建立全局记忆,再执行章节和页面任务。
- 03只在图表、公式和特殊版面触发视觉模型,普通文本由主模型处理。
- 04当引用缺失、重点遗漏或上下文断裂时自动生成修复指令并重试。
证据
工作流机制
Planner / Reasoner、Tool-Use、检索来源、质量评分和重试规则是核心证据。
过程监督
记录执行轨迹、工具路径、失败原因和修复结果,为后续过程奖励提供数据。
边界
- 这是研学 Agent 工作台和产品原型,不声称已是大规模机构生产系统。
- 公开页面不包含私有笔记、用户数据、凭据和原始长文档。
- Agentic RL 是基于轨迹数据的后续方向,不写成已完成训练的策略模型。
岗位映射
- Agent 产品:把模糊学习任务转成可规划、可调用工具的工作流。
- LLM Eval / Agent workflow:展示质量门禁、重试条件和过程轨迹。
- 开发者/学习产品:通过拓扑、证据和评分界面让模型行为可检查。