Home
avatar

.Sam

【智能体测评-08】动手搭一套Agent测评流水线:开源工具链实战

智能体测评

【智能体测评-08】动手搭一套Agent测评流水线:开源工具链实战

这是“智能体测评”系列的第8篇。前7篇我们讲了方法论——测什么、怎么判、怎么建测评集、怎么分析轨迹。这篇不一样:我们把这些方法论变成一套可以跑的代码。你将看到一个最小可用的Agent测评流水线,从任务定义到报告生成,全链路开源实现。为什么需要流水线,而不是脚本很多团队的“Agent测评”停留在这个阶

【智能体测评-07】自建测评集方法论:别再拿20条case自欺欺人了

智能体测评

【智能体测评-07】自建测评集方法论:别再拿20条case自欺欺人了

这是“智能体测评”系列的第7篇。第6篇讲了轨迹测评,解决的是“过程怎么看”。这一篇解决一个更基础的问题:不管你的评分方法多科学、轨迹分析多精细,如果测评任务本身设计得不好,所有结论都是空中楼阁。我们来聊聊怎么构建一套真正有信号量的Agent测评集。20条case的幻觉几乎每一个做Agent的团队都经

【智能体测评-06】轨迹测评:不只看做没做成,还要看怎么做的

智能体测评

【智能体测评-06】轨迹测评:不只看做没做成,还要看怎么做的

这是“智能体测评”系列的第6篇。第5篇讲了LLM-as-Judge的可靠性问题,解决的是“评分怎么判”。这一篇解决另一个问题:只看最终结果的成败,会丢掉关于Agent能力的大量信号。我们需要把Agent的行动过程本身作为测评对象。一个成功率掩盖的问题假设你在对比两个版本的CodingAgent:版本

【智能体测评-05】LLM-as-Judge的可靠性问题:让模型当裁判到底靠不靠谱

智能体测评

【智能体测评-05】LLM-as-Judge的可靠性问题:让模型当裁判到底靠不靠谱

这是“智能体测评”系列的第5篇。上一篇《【智能体测评-04】主流AgentBenchmark全景拆解》里我们看到,大部分benchmark的评分要么靠精确匹配,要么靠测试用例——但真实Agent任务的输出往往是开放性的:一段分析报告、一个操作序列、一次多轮对话。这些“没有标准答案”的输出怎么评分?业

【智能体测评-04】主流Agent Benchmark全景拆解:GAIA、SWE-bench、WebArena、τ-bench、BrowseComp到底在测什么

智能体测评

【智能体测评-04】主流Agent Benchmark全景拆解:GAIA、SWE-bench、WebArena、τ-bench、BrowseComp到底在测什么

这篇是2026年8月的全景概览,对benchmark的深入拆解已独立成一个新系列——《Benchmark拆解》,从“怎么读懂一个跑分”的角度逐个讲透,并补充了SWE-benchPro、GAIA2、τ²-bench、OSWorld、Terminal-Bench等新内容。事实更新:本文写作后,SWE-b

【智能体测评-03】测评的四个层次:从单元测试到生产观测

智能体测评

【智能体测评-03】测评的四个层次:从单元测试到生产观测

这是“智能体测评”系列的第3篇。上一篇《【智能体测评-02】Agent失败分类学》回答了“Agent能出什么错”。这一篇回答另一个问题:在什么粒度上、用什么方式抓这些错。我们会展开总纲里提到的L1-L4四层框架,讲清楚每一层测什么、怎么测、花多少钱、踩什么坑。为什么要分层很多团队做Agent测评的方

【智能体测评-02】Agent失败分类学:智能体是怎么把事情搞砸的

智能体测评

【智能体测评-02】Agent失败分类学:智能体是怎么把事情搞砸的

这是“智能体测评”系列的第2篇。上一篇《【智能体测评-01】从模型跑分测到智能体测评的范式断裂》提出了Agent能力的六维模型。这一篇我们给每个维度填入具体的失败模式——不是泛泛地说“Agent会犯错”,而是建立一套可以定位、可以计数、可以测试的失败分类体系。为什么需要失败分类学如果你问一个工程师“

【智能体测评-01】从模型跑分测到智能体测评的范式断裂

智能体测评

【智能体测评-01】从模型跑分测到智能体测评的范式断裂

这是“智能体测评”系列的第1篇。上一篇《我们的智能体测评体系:总纲》画了全局地图。从这篇开始,我们逐层拆开讲。这一篇解决一个根本问题:为什么不能用大模型跑分的思路来测智能体。一个让人不安的现象2024年以来,几乎每个月都有新的Agent产品发布,几乎每个发布都配了一张亮眼的benchmark成绩表:

Hermes Agent 深入浅出研究

AI

Hermes Agent 深入浅出研究

一、HermesAgent到底是什么?HermesAgent是硅谷知名AI实验室NousResearch在2026年2月正式开源的自主AI智能体框架,定位是「会随着使用不断成长的自进化数字员工」,核心理念是打破传统AI工具只能被动响应指令的限制,让AI可以成为长期在线、自主学习、能力不断提升的个性化

杨植麟团队新突破:让大模型「不健忘」的注意力残差,到底是什么黑科技?

AI

杨植麟团队新突破:让大模型「不健忘」的注意力残差,到底是什么黑科技?

如果你经常用大模型聊天或者做复杂任务,大概率遇到过这些frustrating的场景:你跟它聊了10轮对话,提到过自己是做产品经理的,结果后面它又问你「你的职业是什么?」你上传了一份100页的文档让它总结,结果它漏掉了第3页提到的核心项目目标让它解一道需要5步推理的数学题,它前两步算对了,后面就忘了前

OpenClaw技术原理分析

openclaw

OpenClaw技术原理分析

🔥31万星标爆火AI项目OpenClaw技术原理全拆解!这份6500字深度报告一次性讲透:✅从Clawdbot到OpenClaw的完整演进历程✅本地优先+隐私可控的核心设计逻辑✅分层架构+核心组件工作机制全解析✅实际场景下的完整工作流程演示✅4大关键技术创新点拆解✅对AIAgent产业落地的价值分

OpenClaw多Agent协作完整使用教程

openclaw

OpenClaw多Agent协作完整使用教程

本文基于OpenClawv2026.3.13最新官方版本编写,所有信息均来自官方开源仓库:openclaw/openclaw🦞一、OpenClaw概述OpenClaw是一款可以运行在任意设备、任意平台的个人AI助手,2025年11月开源至今已获得31.1万+Star,5.9万+Fork,是目前全球

挣脱AI Agent的记忆枷锁:开源神器OpenViking如何重构上下文管理范式

AI

挣脱AI Agent的记忆枷锁:开源神器OpenViking如何重构上下文管理范式

2026年被行业公认为AIAgent大规模落地的元年,而所有从业者都在面临同一个核心难题:如何让智能体既拥有长期记忆,又不会被飙升的Token成本和混乱的上下文拖垮?1月字节跳动火山引擎Viking团队开源的OpenViking给出了一个突破性的答案,上线两个月GitHub星标就突破1200+,采用

1 34