标签:评测
共 2 篇文章。
-
AI 编程 Agent 内部基准设计
讲清团队如何为 AI 编程 Agent 设计内部基准,覆盖任务集、评分维度、回归门禁与人审流程,避免只看公开榜单做错误优化。
-
LLM 评测 Golden Set 构建方法
系统介绍如何为 LLM 应用构建高质量评测基准集(Golden Set),涵盖数据采集、标注策略、维护机制与自动化评分实践,帮助团队建立可持续的模型质量体系。
共 2 篇文章。
讲清团队如何为 AI 编程 Agent 设计内部基准,覆盖任务集、评分维度、回归门禁与人审流程,避免只看公开榜单做错误优化。
系统介绍如何为 LLM 应用构建高质量评测基准集(Golden Set),涵盖数据采集、标注策略、维护机制与自动化评分实践,帮助团队建立可持续的模型质量体系。