科技中国

AI
业界 手机 电脑 数码 智车 AI 苹果 直播
当前位置: 首页 > AI > 正文

谷歌发布 FACTS Grounding 基准:Gemini、GPT-4o、Claude 当评委,成 AI 大语言模型“幻觉照妖镜”

2024-12-18 17:11:15 来源:IT之家 A+A-

12 月 18 日消息,谷歌 DeepMind 团队于 12 月 17 日发布博文,宣布推出 FACTS Grounding 基准测试,评估大型语言模型(LLMs)根据给定材料是否准确作答,并避免“幻觉”(即捏造信息)的能力,从而提升 LLMs 的事实准确性,增强用户信任度,并拓展其应用范围。

数据集

在数据集方面,ACTS Grounding 数据集包含 1719 个示例,涵盖金融、科技、零售、医疗和法律等多个领域,每个示例包含一篇文档、一条要求 LLM 基于文档的系统指令和随附的提示词。

示例文档长度不一,最长可达 32000 个 token(约 20000 字)。用户请求涵盖摘要、问答生成和改写等任务,但不包含需要创造力、数学或复杂推理的任务。附上演示图片如下:

数据集分为 860 个“公共”示例和 859 个“私有”示例,目前已发布公共数据集供评估使用,私有数据集用于排行榜评分,以防止基准污染和排行榜作弊。

评估方案

在评估方案上,FACTS Grounding 采用 Gemini 1.5 Pro、GPT-4o 和 Claude 3.5 Sonnet 3 款模型作为评委,评估答案的充分性、事实准确性和文档支持性。

评估分为两个阶段:首先评估响应是否符合资格,即是否充分回答了用户请求;然后评估响应的事实准确性,即是否完全基于所提供的文档,有没有出现“幻觉”,然后基于该模型在所有示例上的平均得分,最终计算得出。

在 FACTS Grounding BenchmARk 中,谷歌的 Gemini 模型在事实准确的文本生成方面取得了最高分。

附上参考地址

  • Google DeepMind launches new AI fact-checking benchmark with Gemini in the lead

  • FACTS Grounding: A new benchmark for evaluating the factuality of large language models

Tags:FACTS Grounding
(责任编辑:Diy92)

推荐阅读 相关文章

大模型“自动修复bug”能力将大大提升,豆包团队开源首个多语言代码修复基准 Multi-SWE-bench

4 月 10 日消息,豆包大模型团队今日通过官方公众号宣布,首个多语言类 SWE 数据集 Mu...[详细]

2025-04-11 07:44:56

谷歌推出Vertex AI Media Studio文生视频套件:自动包办画面渲染、旁白、配乐等

4 月 10 日消息,谷歌今天(4 月 10 日)推出 Vertex AI Media Studio 平台,该套件支持文...[详细]

2025-04-11 07:44:56

广东公布中小学AI教育方针:原则上1-4年级每年不少于6课时

4 月 10 日消息,据南方日报今日报道,广东省新闻办与省教育厅在新闻发布会上正式发布...[详细]

2025-04-11 07:44:56

得州大学奥斯汀分校开发新型AI智能体 Metamon:能跟人一样玩宝可梦

4 月 10 日消息,据外媒 ASCII 今日报道,美国得克萨斯大学奥斯汀分校的 Yuke Zhu 助...[详细]

2025-04-11 07:44:56

中国首个高速动车组空气动力学智能化仿真大模型问世

3 月 27 日消息,据中国中车今日消息,2025 年 3 月,中国高速动车组空气动力学智能化仿真大模型在青岛成功问世,推...[详细]

2025-03-28 07:30:56

谷歌发布 FACTS Grounding 基准:Gemini、GPT-4o、Claude 当评委,成 AI 大语言模型“幻觉照妖镜”

12 月 18 日消息,谷歌 DeepMind 团队于 12 月 17 日发布博文,宣布推出 FACTS Grounding 基准测试,评估大型语言...[详细]

2024-12-18 17:11:15

联系方式