01Code-QA-Bench 在真实代码仓库中定位、追踪并解释实现,同时区分代码阅读、参数记忆与文档利用。 10 个 SWE-Bench Python 仓库(固定 commit) GPT-5.4 LLM judge · 三轴连续评分 已发布 完整 Benchmark Data Card