LF Lens Frontier 评测数据平台
01 榜单 02 Benchmarks 03 博客
菜单
01 榜单 02 Benchmarks 03 博客
中文 EN
← 返回全部 Blog BLOG / TOPIC

#benchmark

3 项研究发布

相关发布

评测方法 2026/6/16 一个客观的代码重构评估体系是如何构成的

以行为保持和结构静态检查为核心,用真实开源代码提交做数据、隔离环境测试、用 tree-sitter 做语法树匹配,避开大模型当裁判带来的主观漂移,精准测量大模型的代码重构能力边界。

洞察 2026/6/12 题面写得再绕,模型照样秒解——怎么让搜索题真正变难

搜索智能体训练需要难度适中的题:模型不能秒解,但认真搜索可解。我们设计了 Hardener-Solver-Critic 多智能体闭环,用模型真实求解行为增强题目难度,在 BrowseComp 风格合成题上将 62% 的样本推入了可训练区间。

洞察 2026/5/21 如何构建面向文生图模型的多模块协同评估框架

以 LLM-as-a-Judge 为核心,通过 OCR/VQA/CLIP/IQA/HP 五模块协同校准,突破单一指标 benchmark 局限,全面捕捉现代文生图模型的真实能力边界。

Lens Frontier 模型评测数据平台

发布评测研究;榜单与 Data Card 仅在资料审核完成后上线。

探索 榜单Benchmarks
研究 博客研究主题时间线
实验室 关于
© 2026 Lens Frontier
GitHub RSS
TOP ↑