2 项研究发布
以行为保持和结构静态检查为核心,用真实开源代码提交做数据、隔离环境测试、用 tree-sitter 做语法树匹配,避开大模型当裁判带来的主观漂移,精准测量大模型的代码重构能力边界。
以 LLM-as-a-Judge 为核心,通过 OCR/VQA/CLIP/IQA/HP 五模块协同校准,突破单一指标 benchmark 局限,全面捕捉现代文生图模型的真实能力边界。