2026-09-29 · cs.SE, cs.AI arXiv 分类代码,例如 cs.SE 表示 Software Engineering,cs.AI 表示 Artificial Intelligence,cs.CL 表示 Computation and Language。 · score 9.0 score 是生成器和模型对这篇论文进入日报价值的 0-10 分判断,越高越值得优先读。
一句话总结 模型把论文核心贡献压缩成一句话,帮助你快速判断是否继续读。
自动从开源智能体项目中持续发现并复现真实 harness 缺陷,构建可动态扩展的评估基准。
为什么重要
现有 harness 缺陷基准规模小、构造成本高,阻碍了软件智能体修复这类缺陷的进展。该工作将真实故障转化为可执行的评估样本,并证明了从中可抽取出可复用的修复技能来提升智能体修复率,为智能体的递归自改进提供了一条可规模化的工程路径。
可执行启发
开发者可利用该工具自动收集自身项目中的 harness 缺陷,生成持续更新的评估集;修复技能库的思路也可迁移到其他领域的 agent 修复流水线中。
去 hype 去掉营销和夸张表述,说明这篇论文真实价值、限制和需要谨慎看待的地方。:真实价值在于把 harness bug 的复现和基准构建从手工劳作转变为自动化流水线,并展示了如何用真实修复知识反哺智能体。限制在于复现成功率仍依赖底层大模型能力,且所抽取的修复技能泛化性可能受限于样本覆盖的 harness 模式。
原题:AgentBug-Smith: Automatically Reproducing Real-World Harness Bugs in Agentic Systems
软件工程AI agent缺陷复现harness 工程基准测试
deepseek-ai/DeepSeek-V4-Pro
2026-09-27 · cs.AI, cs.CL, cs.SE arXiv 分类代码,例如 cs.SE 表示 Software Engineering,cs.AI 表示 Artificial Intelligence,cs.CL 表示 Computation and Language。 · score 8.0 score 是生成器和模型对这篇论文进入日报价值的 0-10 分判断,越高越值得优先读。
一句话总结 模型把论文核心贡献压缩成一句话,帮助你快速判断是否继续读。
提出双层搜索框架,通过元驱动器迭代进化基准生成流程以应对静态基准饱和。
为什么重要
现有基准进化方法仅对单个任务做扰动,仍受硬编码规则限制。该工作首次将优化对象从任务级别提升到基准生成流水线,实现端到端自动进化,能持续产出更具挑战性和区分度的评测集,对缓解LLM基准饱和有直接工程价值。
可执行启发
开发者可借鉴其内外双循环架构,将评测集生成流程本身作为可搜索和优化的组件,从而构建自我进化的持续评测体系。对于负责模型评估的团队,该框架提供了一种自动生产高难度、不易被快速刷榜的基准的方法。
去 hype 去掉营销和夸张表述,说明这篇论文真实价值、限制和需要谨慎看待的地方。:真实价值在于将优化对象从任务实例扩展到生成流水线,但依赖历史轨迹进行搜索,可能对完全不相关的领域泛化能力有限;目前仅展示了在编程竞赛和数学题上的效果,距离通用领域自动生成高质量评测还有距离。
原题:MetaBench-Harness: Unlocking End-to-End Optimization of Benchmark Harnesses
基准测试LLM评测基准进化双层搜索评估工程
deepseek-ai/DeepSeek-V4-Pro
2026-09-28 · cs.SE, cs.AI, cs.CL arXiv 分类代码,例如 cs.SE 表示 Software Engineering,cs.AI 表示 Artificial Intelligence,cs.CL 表示 Computation and Language。 · score 8.0 score 是生成器和模型对这篇论文进入日报价值的 0-10 分判断,越高越值得优先读。
一句话总结 模型把论文核心贡献压缩成一句话,帮助你快速判断是否继续读。
多轮基准揭示 coding agents 随轮次增加逐渐停止探索仓库代码,50.8% 的任务链产生重复逻辑。
为什么重要
现有评测仅关注功能通过率,忽视了 agents 在真实多轮仓库开发中是否复用现有实现,导致隐性冗余积累。该工作提出的 RepoReuse 基准通过 AST 依赖图、执行验证等手段量化复用率和结构冗余,揭示 agents 在探索仓库和利用历史上下文方面的退化模式,这些缺陷是传统通过率不可见的。对构建可维护、可审计的仓库级 AI 开发工具链条至关重要。
可执行启发
开发者在设计 coding agent 工作流时,不应只以单任务通过率为优化目标,需引入复用检测与审计机制,避免将冗余逻辑持续注入代码库。工具链可考虑基于该基准的思想,为 agent 输出提供复用性回溯与重构提示。
去 hype 去掉营销和夸张表述,说明这篇论文真实价值、限制和需要谨慎看待的地方。:真实价值在于填补了“功能通过率”之外的另一维评测空白,揭示复用退化和隐藏冗余。局限性在于该工作本身是诊断性的,并未给出如何增强 agent 复用能力的具体方法,但问题定义和自动化基准构建流程具备良好的工程迁移性。
原题:Do Coding Agents Reuse Existing Code or Reinvent the Wheel?
coding agents代码复用基准评测多轮开发软件工程
deepseek-ai/DeepSeek-V4-Pro
2026-09-29 · cs.SE, cs.AI arXiv 分类代码,例如 cs.SE 表示 Software Engineering,cs.AI 表示 Artificial Intelligence,cs.CL 表示 Computation and Language。 · score 8.0 score 是生成器和模型对这篇论文进入日报价值的 0-10 分判断,越高越值得优先读。
一句话总结 模型把论文核心贡献压缩成一句话,帮助你快速判断是否继续读。
仅靠整体准确率会掩盖代码复杂度升高时模型理解能力大幅下降的事实。
为什么重要
论文表明用圈复杂度、嵌套深度等软件度量分组评估,能更诊断性地暴露 LLM 在真实工程场景中的可靠性风险。它为评估 coding agent 或代码助手提供了远比聚合分数更有工程诊断力的方法论。
可执行启发
在集成 LLM 到代码审查或行为预测工具时,需按函数复杂度细分评估,Low 区的高准确率不一定能泛化到 Medium/High 区。可直接借鉴这种基于传统软件度量的分层评估模板,建立内部持续评估体系。
去 hype 去掉营销和夸张表述,说明这篇论文真实价值、限制和需要谨慎看待的地方。:真实价值在于提供可复用的评估框架而非新模型。局限是只在两个模型和 300 个 Python 函数上验证,且手工语义理解子集较小;泛化到其他语言或更大规模仍需更多证据。没有宣称模型革命性提升,更多是工程评测的改进。
原题:Complexity-Aware Evaluation of LLM Comprehension
LLM评估代码理解复杂度感知软件工程基准测试
deepseek-ai/DeepSeek-V4-Pro
2026-09-29 · cs.SE, cs.AI arXiv 分类代码,例如 cs.SE 表示 Software Engineering,cs.AI 表示 Artificial Intelligence,cs.CL 表示 Computation and Language。 · score 8.0 score 是生成器和模型对这篇论文进入日报价值的 0-10 分判断,越高越值得优先读。
一句话总结 模型把论文核心贡献压缩成一句话,帮助你快速判断是否继续读。
对六个开源RAG漏洞检测系统进行可控复现与组件级分析,暴露性能落差和流程对齐瓶颈。
为什么重要
该工作直面检索增强型漏洞检测研究中的可复现性危机,通过统一基准和组件分解,揭示了端到端评测掩盖的流水线不协调问题。结果指出,即使检索达到最优,检测准确率仍低,说明单纯提升检索不足以构建可靠检测。
可执行启发
构建RAG漏洞检测系统时,不应只优化检索或模型,而需围绕任务对齐各组件,并在流水线级别进行诊断评测,而非仅依赖端到端指标。
去 hype 去掉营销和夸张表述,说明这篇论文真实价值、限制和需要谨慎看待的地方。:真实价值在于标准化评测框架和组件分析方法论,而非提出新模型;局限是评测仍局限于特定数据集与开源模型,且组件分析结论目前限于再现的六种系统。
原题:Retrieve, Reproduce, Reveal: Dissecting Retrieval-Augmented Software Vulnerability Detection
检索增强生成软件漏洞检测可复现性系统评测工具链
deepseek-ai/DeepSeek-V4-Pro