韩国科学技术信息通信部于27日公布了其独立人工智能基础模型项目第二轮评估的详细分数。结果显示,尽管 Motif Technologies 在全球 AAII 基准测试中得分最高,仍然被淘汰。争议源于用户评估分数最终决定了排名结果:在该项评估中,Motif 获得 14.1 分,而排名第一的 SK Telecom 获得 19.1 分。这是“Dokpamo”项目第二次出现评估争议,此前 Naver Cloud 曾因不符合独立性标准而被淘汰。

部委公布详细评估分数

韩国科学技术信息通信部公布的完整评分明细显示,SK Telecom 以 70.6 分排名第一,随后依次为 Upstage(69.9 分)、LG AI Research(69.0 分)和 Motif(65.8 分)。Motif 在 AAII 评估中获得 11.9 分,在用于评估韩语能力和可靠性的 NIA 基准测试中获得 12.7 分,两项基准测试合计 24.6 分,为四支团队中最高。然而,Motif 在专家评估中仅获得 27.1 分,是四支团队中最低的。

用户评估决定最终结果

用户评估分数被证明是决定最终排名的关键因素。根据已公布的分数反推,Motif 在用户评估中获得 14.1 分,而 SK Telecom 获得 19.1 分,双方相差 5 分。SK Telecom 与 Motif 的最终得分相差 4.8 分,这表明用户评估实际上决定了淘汰结果。

关于评估标准的争论仍在继续

Motif 认为,基础模型的价值在于具备可跨行业、跨服务扩展的基础性能,而不只是提供聊天机器人的便利性。政府表示,评估不仅要考察模型性能,还必须全面评估其实际可用性和应用潜力。该部表示,评估标准和方法此前已与参与企业协商确定,当时没有收到任何异议。Motif 在结果公布后宣布不参加第三轮评估。

常见问题

四家人工智能公司在韩国基础模型评估中分别获得了多少分?

在27日公布的第二轮评估中,SK Telecom 以 70.6 分排名第一,Upstage 获得 69.9 分,LG AI Research 获得 69.0 分,Motif 获得 65.8 分。

为什么 Motif 在人工智能基准测试中得分最高,却仍然被淘汰?

Motif 以 24.6 分的基准测试总成绩排名第一,但其专家评估得分最低,仅为 27.1 分;同时,其用户评估得分为 14.1 分,而 SK Telecom 为 19.1 分。最终两者的总分相差 4.8 分,导致 Motif 被淘汰。

免责声明:以上内容(如有图片或视频亦包括在内)均为平台用户上传并发布,本平台仅提供信息存储服务,对本页面内容所引致的错误、不确或遗漏,概不负任何法律责任,相关信息仅供参考。

本站尊重他人的知识产权、名誉权等法律法规所规定的合法权益!如网页中刊载的文章或图片涉及侵权,请提供相关的权利证明和身份证明发送邮件到909075378@qq.com,本站相关工作人员将会进行核查处理回复

点赞(0) 打赏

评论列表 共有 0 条评论

暂无评论

微信小程序

微信扫一扫体验

立即
投稿

微信公众账号

微信扫一扫加关注

发表
评论
返回
顶部