OpenAI 宣布开源 SimpleQA 新基准,专治大模型「胡言乱语」
2024 年 10 月 31 日
OpenAI 推出名为 SimpleQA 的新开源基准,旨在衡量语言模型在回答事实寻求问题时的准确性。该基准通过确保问题答案的正确性和多样性,以及挑战性,旨在解决现有语言模型生成错误或未经证实答案的问题。SimpleQA 具有简洁的问题和答案格式,便于评估,并且经实验证明对前沿模型如 GPT-4o 具有挑战性。然而,SimpleQA 的准确性仅限于短查询的事实导向问题。OpenAI 希望通过开源 SimpleQA 促进 AI 研究,进一步提升模型的可信度和可靠性,并已提供开源链接和论文供研究参考。
OpenAI 推出 SimpleQA 新基准,治理 AI 大模型乱说话现象
ITBear 科技资讯
OpenAI 发布 SimpleQA 新基准,助力语言模型准确性大提升
ITBear 科技资讯
2026-09-19
OpenAI 研究员称新模型核心目标是递归自我改进2026-09-13
OpenAI 将退役 GPT-5.3-Codex-Spark 模型2026-09-06
OpenAI 多次修改 GPT-6 Astra 测试数据,部分成绩大幅变化2026-09-03
OpenAI 预告即将发布 Astra 模型,名称可能为 GPT-6-Astra2026-09-02
OpenAI 将限制新模型网络安全功能的访问权限2026-08-31
ChatGPT 新模型 Bel 被曝预训练完成,参数高达 10 万亿2026-08-26
OpenAI 已预训练 Bel 模型:超 10T 参数,冲击通用人工智能2026-08-11
OpenAI 全新 GPT Image 模型亮相2026-08-07
OpenAI:免费用户默认模型升级为 GPT-5.6 Luna2026-07-31
OpenAI 表示其模型目前已覆盖超过 10 亿活跃用户查看更多
体验专业版特色功能,拓展更丰富、更全面的相关内容。