标注数据管理 / 首页
正在连接服务
数据总览

标注需求

查找已有需求和结果,进入具体需求后再执行、评估、抽样,并从已完成 Run 生成候选。

标注需求全部历史均保留
数据快照来自 Langfuse
等待人工确认异常项目优先
待处理反馈按问题和需求追踪

全部标注需求

先搜索是否已经存在相同用途的数据。

创建需求

创建标注需求

先创建空的标注需求;进入详情页后再添加一个或多个 Langfuse 问题集合。执行和评估将在需求创建成功后的详情页中分别发起

需求说明

名称和用途将用于后续搜索、执行、评估与审计。

读取中

标注需求详情

正在读取需求说明。

问题集合
总问题
已人工审核问题数
运行次数0
评估次数0
正在读取语义函数覆盖情况…

运行结果

每次运行分别展示执行器、版本、模型、问题数量和运行成败;评估结果不会覆盖原始运行事实。

选择 Run

每个数据集最多选择一个 Run;参数不同的 Run 不可同时选择。饼图只按勾选的 Run 聚合。

尚未选择
尚未选择运行结果勾选一个或多个 Run 后查看全链路结果分布。

在线 / 离线 ORM 准确率曲线

从当前数据集已完成的运行结果中指定在线和离线角色,也不需要再次选择数据集;系统按当前 GT 动态计算,查看图表不会重新执行问题。

在线、离线可以分别选择多个数据集 Run;两侧选中的数据集集合必须完全一致。
尚未选择运行结果切换运行结果只会使用当前 GT 和当前抽样还原方法重算,不会再次执行问题。

执行 / 评估进度

统一按批次和数据集 Run 展示真实状态、完成数量与失败原因,不填充未回写的虚假进度。

正在读取执行与评估进度…
只读查看,不会改变运行队列。

问题数据内容

按问题集合快速定位问题;进入详情后可切换每个已结束的 Run,对照当前 GT、最终答案、执行过程和评估结果。

第 1/1 页,共 0 条

问题详情

选择 Run 对照其逐题结果与当前有效 GT;执行过程和原始证据按需展开,这里不能直接修改标注内容。

请选择问题

添加问题集合

把 Langfuse Dataset 作为可被任意注册执行器复用的问题集合加入当前标注需求;已有运行会按后端规则发现并关联。

发起执行

只运行执行器,不自动开始评估;执行参数会作为本次 Run 的不可变事实保存。

选择执行器后读取参数。

选择问题集合

一次可选择一个、多个或全部问题集合;每个问题集合会保留自己的真实 Run。

发起 GT 对比评估

选择一个或多个已结束的具体 Run,使用当前有效 GT 做确定性对比;每个所选 Run 都会生成独立、可追溯的评估记录。

选择 Run

按真实完成时间倒序展示;每条 Run 保留执行时冻结的执行器 Profile Revision,不使用浏览器当前版本代替历史。

正在读取可用 Run…
请选择具体 Run系统只评估所选 Run 中已有有效 GT 的问题。

标注任务

创建新任务,或进入已有任务查看全部问题和标注进度。

已有标注任务

每个任务只固定问题范围、责任人员和抽样预算,不绑定执行器或标注口径。

创建标注任务

勾选一个或多个问题集合,创建一个整体标注任务;所选集合会共同组成这一个任务的固定范围。

选择标注范围

这是同一个任务内的多选范围,不会按数据集拆成多个任务。范围只依据 canonical 问题冻结,不读取 Run、评估或历史答案。

当前仅使用 RANDOM 单层等概率无放回抽样;每个任务都从所选 canonical 问题全集独立抽取,不依据历史执行、评估或抽样记录排除问题。

标注任务

标注任务

进入任务后查看全部问题,再选择已完成 Run 生成候选。

任务问题0本任务固定范围
已有候选或 GT00%
当前 GT0已形成答案 GT 或裁定 GT
正在读取人工审核分工…

任务问题

显示本任务范围内的全部问题

尚未选择问题请选择左侧问题查看候选状态和只读结果。

选择 Run 生成候选

为当前任务选择一个已完成 Run,生成未确认候选。

Run 只作为候选来源:已发布 current GT 不覆盖;切换 Run 只替换尚未确认候选;若 Workflow 只有最终 ORM,会标记为部分候选并在矫正时补齐六阶段结构。

人工审核

个人审核任务

查看当前审核员负责的问题和审核记录。

请从任务总览选择审核员
问题责任审核员处理优先级需要关注等待时间
正在读取待确认项目…
人工复核

人工复核

逐题查看 Run 候选结果、理由和规则证据。

问题

当前问题的关注点会显示在这里。

待确认

请选择一个待确认项目

请选择一个待确认项目

确认候选处置建议

认可后使用候选已保存的处置类型、理由和事实依据,不需要重复填写。

使用反馈

反馈

关联具体需求或问题说明现象。反馈不会直接修改原标注。

全部反馈
处理中
反馈编号相关数据问题描述状态提交人
正在读取反馈…

提交反馈

说明问题和影响,后续处理将新增记录。

查看并处理反馈

先核对问题和当前有效 GT;处理结论不会直接修改标注。

正在读取反馈上下文…

申请补充能力

选择 Agent 已发现的能力缺口并描述业务期望;具体设计、实现、接入和验证由 Agent 或对应开发流程完成。

候选函数审核

语义函数审核

候选提交、审核、退回、拒绝和正式入库都在标注系统的语义函数审核模块内完成。

读取工作流角色…
当前操作模式
语义函数数量趋势按需查看测试集与 RAG 数量变化
标注口径

标注口径版本管理

当前版本

请选择标注口径

版本、创建人和修改原因会显示在这里。

各步骤的判断规则

请选择一个版本查看。

版本记录

暂无版本记录。

新建标注口径

英文名同时是 Langfuse 下的口径目录名;节点 Prompt 会按指定 DAG 逐个创建。

各步骤判断规则

可新增、删除、排序步骤,选择前置步骤和最终节点。

创建标注口径新版本

只能修改节点 Prompt 正文和节点说明;节点中英文名、顺序、依赖、输出合同及最终节点保持不变。

各步骤判断规则

结构只读;仅可修改 Prompt 正文和节点说明。