
2026 48篇文章
09-06 【LLM测评-08】怎么给自家 LLM 出题:从读榜到自建评测 #LLM测评 #Benchmark #自建评测 #科普 #工程实践 09-06 【LLM测评-07】榜单会腐烂:污染、刷分与退役 #LLM测评 #Benchmark #数据污染 #科普 #评测治理 09-06 【LLM测评-06】从“答题”到“干活”:Agent 测评到底在测什么 #LLM测评 #Benchmark #Agent #GAIA #τ-bench #科普 09-06 【LLM测评-05】代码:从“写个函数”到“修好一个真实 bug” #LLM测评 #Benchmark #代码 #SWE-bench #HumanEval #科普 09-06 【LLM测评-04】AI 的数学能力:从小学应用题到研究级难题 #LLM测评 #Benchmark #数学 #AIME #科普 09-06 【LLM测评-03】GPQA:AI 是真会推理,还是背得多? #LLM测评 #Benchmark #GPQA #推理 #科普 09-06 【LLM测评-02】MMLU:当一场考试被考到“饱和” #LLM测评 #Benchmark #MMLU #科普 #饱和 09-06 【LLM测评-01】一份跑分表,到底该怎么读? #LLM测评 #Benchmark #科普 #Harness 09-06 【LLM测评-00】AI 为什么也要“考试”? #LLM测评 #Benchmark #科普 #评测方法 09-02 【AI Native开发-04】如何写一份 AI 能执行的 Spec #AI Native #SDD #Spec #需求工程 #软件工程 09-01 【AI Native开发-16】把 SDD 变成团队的 AI Native 研发系统 #AI Native #SDD #团队协作 #研发体系 #CI #规模化 09-01 【AI Native开发-15】测试失败后应该回到哪里:失败归因与回退地图 #AI Native #SDD #失败归因 #回退 #根因 #软件工程 09-01 【AI Native开发-14】Verify:从“测试通过”到“需求被证明” #AI Native #SDD #Verify #需求追踪 #验收 #测试工程 09-01 【AI Native开发-13】测试执行:从单用例到质量流水线 #AI Native #SDD #测试执行 #质量流水线 #CI #测试工程 09-01 【AI Native开发-12】测试调试:让 AI 依据证据定位失败 #AI Native #SDD #测试调试 #根因定位 #flaky #测试工程 09-01 【AI Native开发-11】自动化用例:从文本用例到测试代码 #AI Native #SDD #自动化测试 #测试代码 #测试工程 09-01 【AI Native开发-10】测试设计:从 Spec 生成文本用例 #AI Native #SDD #测试设计 #文本用例 #需求追踪 #测试工程 09-01 【AI Native开发-09】AI Native 模式下的代码评审与变更控制 #AI Native #SDD #代码评审 #变更控制 #软件工程 09-01 【AI Native开发-08】Implement:让 AI 按计划改代码 #AI Native #SDD #Implement #代码实现 #软件工程 09-01 【AI Native开发-07】AI 动手前的人类闸门:Spec 与 Plan 评审 #AI Native #SDD #评审 #质量闸门 #软件工程 09-01 【AI Native开发-06】从 Spec 到 Plan:让 AI 先研究再动手 #AI Native #SDD #Plan #技术方案 #软件工程 08-31 【AI Native开发-05】技术不确定怎么办:用 Spike 把未知挡在实现之前 #AI Native #SDD #Spike #技术验证 #软件工程 08-31 【AI Native开发-03】上下文工程:让 AI 真正理解你的项目 #AI Native #SDD #上下文工程 #软件工程 08-29 【AI Native开发-02】从一句需求到一次交付:SDD 四道闸门如何拦住错误 #AI Native #SDD #软件工程 #测试工程 08-29 【AI Native开发-01】AI Coding 最危险的地方:它会把没决定的事情直接做成代码 #AI Native #SDD #AI Coding #软件工程 08-29 【AI Native开发-00】AI Native开发到底是什么 #AI Native #SDD #AI Coding #软件工程 08-27 【智能体测评-番外】测评之前:让智能体可测的工程准备 #AI Agent #可观测性 #Hook #测评工程 08-27 【智能体测评-10】生产环境的Agent可观测性与持续测评 #AI Agent #可观测性 #持续测评 #生产监控 #金丝雀发布 #L4 08-25 【智能体测评-09】三类典型场景的测评方案:Coding Agent、客服Agent、深度研究Agent #AI Agent #Coding Agent #客服Agent #Deep Research #场景测评 #评分方案 08-25 【智能体测评-08】动手搭一套Agent测评流水线:开源工具链实战 #AI Agent #测评流水线 #Python #开源工具 #CI/CD #实操 08-25 【智能体测评-07】自建测评集方法论:别再拿20条case自欺欺人了 #AI Agent #测评集 #Eval Dataset #黄金集 #回归测试 #数据质量 08-24 【智能体测评-06】轨迹测评:不只看做没做成,还要看怎么做的 #AI Agent #轨迹测评 #Trajectory Eval #可观测性 #测评方法 08-24 【智能体测评-05】LLM-as-Judge的可靠性问题:让模型当裁判到底靠不靠谱 #AI Agent #LLM-as-Judge #评估方法 #偏见 #Rubric 08-24 【智能体测评-04】主流Agent Benchmark全景拆解:GAIA、SWE-bench、WebArena、τ-bench、BrowseComp到底在测什么 #AI Agent #Benchmark #GAIA #SWE-bench #WebArena #τ-bench #BrowseComp 08-24 【智能体测评-03】测评的四个层次:从单元测试到生产观测 #AI Agent #测评方法 #单元测试 #端到端 #可观测性 08-23 【智能体测评-02】Agent失败分类学:智能体是怎么把事情搞砸的 #AI Agent #失败模式 #Error Analysis #分类学 08-23 【智能体测评-01】从模型跑分测到智能体测评的范式断裂 #AI Agent #模型评测 #Benchmark #范式转移 08-23 【智能体测评-00】我们的智能体测评体系:总纲 #AI Agent #评测体系 #LLM #工程实践 04-21 Hermes Agent 深入浅出研究 #agent #hermes #AI #openclaw 03-28 杨植麟团队新突破:让大模型「不健忘」的注意力残差,到底是什么黑科技? #月之暗面 #注意力残差 #AI #大模型 03-16 OpenClaw技术原理分析 #openclaw #技术原理 #深度解析 03-16 从技术原理深度解析OpenClaw爆火的底层逻辑 #openclaw #技术原理 #深度解析 03-14 OpenClaw多Agent协作完整使用教程 #AI #多Agent #openclaw 03-14 挣脱AI Agent的记忆枷锁:开源神器OpenViking如何重构上下文管理范式 #AI 03-13 20260311-GitHub 最近这 4 个 AI 项目,名字我直接给你放出来了🔥 #AI #Github 03-12 20260311-GitHub今日涨星最猛的AI项目!第3个真的绝了🔥 #AI 02-20 探索 React 19 的新特性 #React #JavaScript 01-15 Docker 容器化部署实践 #Docker #DevOps