OpenAI 推出 SWE-Lancer 基准测试
2025 年 2 月 19 日
OpenAI 发布了 SWE-Lancer 基准测试,用于评估模型在真实世界自由软件工程工作的性能。该基准测试包含 1400 多个来自 Upwork 和 Expensify 的任务,总支付金额达 100 万美元。SWE-Lancer 要求模型评估代码补丁和管理决策,从多个选项中选择最佳提案,更真实地反映工程团队的工作。其优势在于使用端到端测试,模拟用户从问题识别到补丁验证的整个工作流程。
2026-05-12
OpenAI 推出 Daybreak 项目:重塑软件安全开发流程2025-07-14
OpenAI 推迟开源大模型发布,重视安全测试2025-06-18
OpenAI 发布 AI 前端自动化测试工具演示版2025-04-11
OpenAI 开源 BrowseComp,重塑 Agent 浏览器评测2025-04-03
OpenAI 宣布推出 AI Agent 评测基准 PaperBench2025-02-23
OpenAI 员工公开指责 xAI:Grok 3 基准测试结果具有误导性2025-02-19
OpenAI 推出 SWE-Lancer 基准测试2025-01-20
OpenAI 资助 AI 数学基准测试引发公正性质疑2024-09-05
万人测试 OpenAI 搜索引擎:活动规划等表现出色,存在「幻觉」等不足2024-08-20
OpenAI 关闭 SearchGPT 候补名单,首批万人测试已招满查看更多
体验专业版特色功能,拓展更丰富、更全面的相关内容。