评测方法
一个客观的代码重构评估体系是如何构成的
以行为保持和结构静态检查为核心,用真实开源代码提交做数据、隔离环境测试、用 tree-sitter 做语法树匹配,避开大模型当裁判带来的主观漂移,精准测量大模型的代码重构能力边界。
方法与协议
说明评测问题如何被转化为任务、数据、指标和验证机制,并保留方法的适用边界、风险与版本。
以行为保持和结构静态检查为核心,用真实开源代码提交做数据、隔离环境测试、用 tree-sitter 做语法树匹配,避开大模型当裁判带来的主观漂移,精准测量大模型的代码重构能力边界。