benchmarks
一个客观的代码重构评估体系是如何构成的
以行为保持和结构静态检查为核心,用真实开源代码提交做数据、隔离环境测试、用 tree-sitter 做语法树匹配,避开大模型当裁判带来的主观漂移,精准测量大模型的代码重构能力边界。
全部内容
按时间汇总 Lens Frontier 的论文、评测方法、数据集版本和模型分析,保留每项研究成果的发布与修订脉络。
以行为保持和结构静态检查为核心,用真实开源代码提交做数据、隔离环境测试、用 tree-sitter 做语法树匹配,避开大模型当裁判带来的主观漂移,精准测量大模型的代码重构能力边界。
梳理 coding agent harness 的代码库检索路线:grep、语义索引、LSP、代码地图、Search Subagent 与工具检索如何走向混合检索。
搜索智能体训练需要难度适中的题:模型不能秒解,但认真搜索可解。我们设计了 Hardener-Solver-Critic 多智能体闭环,用模型真实求解行为增强题目难度,在 BrowseComp 风格合成题上将 62% 的样本推入了可训练区间。
以 LLM-as-a-Judge 为核心,通过 OCR/VQA/CLIP/IQA/HP 五模块协同校准,突破单一指标 benchmark 局限,全面捕捉现代文生图模型的真实能力边界。