
2026 12篇文章
08-27 【智能体测评-番外】测评之前:让智能体可测的工程准备 #AI Agent #可观测性 #Hook #测评工程 08-27 【智能体测评-10】生产环境的Agent可观测性与持续测评 #AI Agent #可观测性 #持续测评 #生产监控 #金丝雀发布 #L4 08-25 【智能体测评-09】三类典型场景的测评方案:Coding Agent、客服Agent、深度研究Agent #AI Agent #Coding Agent #客服Agent #Deep Research #场景测评 #评分方案 08-25 【智能体测评-08】动手搭一套Agent测评流水线:开源工具链实战 #AI Agent #测评流水线 #Python #开源工具 #CI/CD #实操 08-25 【智能体测评-07】自建测评集方法论:别再拿20条case自欺欺人了 #AI Agent #测评集 #Eval Dataset #黄金集 #回归测试 #数据质量 08-24 【智能体测评-06】轨迹测评:不只看做没做成,还要看怎么做的 #AI Agent #轨迹测评 #Trajectory Eval #可观测性 #测评方法 08-24 【智能体测评-05】LLM-as-Judge的可靠性问题:让模型当裁判到底靠不靠谱 #AI Agent #LLM-as-Judge #评估方法 #偏见 #Rubric 08-24 【智能体测评-04】主流Agent Benchmark全景拆解:GAIA、SWE-bench、WebArena、τ-bench、BrowseComp到底在测什么 #AI Agent #Benchmark #GAIA #SWE-bench #WebArena #τ-bench #BrowseComp 08-24 【智能体测评-03】测评的四个层次:从单元测试到生产观测 #AI Agent #测评方法 #单元测试 #端到端 #可观测性 08-23 【智能体测评-02】Agent失败分类学:智能体是怎么把事情搞砸的 #AI Agent #失败模式 #Error Analysis #分类学 08-23 【智能体测评-01】从模型跑分测到智能体测评的范式断裂 #AI Agent #模型评测 #Benchmark #范式转移 08-23 【智能体测评-00】我们的智能体测评体系:总纲 #AI Agent #评测体系 #LLM #工程实践