opinions
为什么 2026 年最强 coding agent 还在用 grep?
梳理 coding agent harness 的代码库检索路线:grep、语义索引、LSP、代码地图、Search Subagent 与工具检索如何走向混合检索。
研究分析
分析 benchmark、evaluation 和真实任务之间的差距。结论可以保留,但需要把事实、推断和不确定性分开。
梳理 coding agent harness 的代码库检索路线:grep、语义索引、LSP、代码地图、Search Subagent 与工具检索如何走向混合检索。
搜索智能体训练需要难度适中的题:模型不能秒解,但认真搜索可解。我们设计了 Hardener-Solver-Critic 多智能体闭环,用模型真实求解行为增强题目难度,在 BrowseComp 风格合成题上将 62% 的样本推入了可训练区间。
以 LLM-as-a-Judge 为核心,通过 OCR/VQA/CLIP/IQA/HP 五模块协同校准,突破单一指标 benchmark 局限,全面捕捉现代文生图模型的真实能力边界。