上海财大发布金融领域大模型评测榜单:理财AI“蚂小财”底座模型排名第一|界面新闻

adminweb 14 0

随着我国“人工智能+”行动加速推进,大模型技术在金融领域的应用持续落地。为全面评估金融领域大模型的专业、可靠程度,近日,上海财经大学推出的国内首个金融领域大模型评估基准升级为FinEval 6.0,新增了金融严谨性等维度并发布首份评测报告。FinEval 6.0对国内外主流大模型的评测显示,蚂蚁集团旗下理财AI“蚂小财”的模型底座在金融严谨性等维度表现突出排名第一,跑赢了众多通用大模型。

上海财大发布金融领域大模型评测榜单:理财AI“蚂小财”底座模型排名第一|界面新闻-第1张图片-催听迷商品网上购买网站货到付款渠道官网店在线网上购买网站在线售卖喷雾用品官网强效类药品交易正品网店渠道批发价格订购物
金融领域大模型应用评测榜单,上财

公开资料显示,上海财经大学是国内最早开展金融领域大模型测评工作的高校,并在2024年参与制定了《金融大模型应用测评指南》,这是全国首个以金融业务能力为核心的团体标准。此次,上海财经大学结合对AI企业、金融机构的调研与投资者洞察,重点完善了FinEval 6.0的严谨性评测样本,从金融学术知识、金融行业理解、金融严谨性测试、金融安全认知、金融智能体应用等关键维度,全面评估大模型在复杂金融业务场景中的表现。

同时,FinEval 6.0对国内外9款有代表性的大模型进行评测,包括DeepSeek-R1、GPT- 4o等通用基础模型,以及金融垂直领域模型。评测报告结果显示,参评模型在金融学术知识方面的表现整体优异,但在金融严谨性、金融行业理解等适配复杂场景的能力上表现各异。其中,理财AI“蚂小财”的模型底座、蚂蚁自研Finix大模型整体表现较好,总分跑赢了通用大模型。尤其在金融严谨性上,行业均值为70.27分,蚂小财超出均值17分显著领先。

上海财大发布金融领域大模型评测榜单:理财AI“蚂小财”底座模型排名第一|界面新闻-第2张图片-催听迷商品网上购买网站货到付款渠道官网店在线网上购买网站在线售卖喷雾用品官网强效类药品交易正品网店渠道批发价格订购物
金融领域大模型应用严谨性评测排名,上财

官方数据显示,“蚂小财”是蚂蚁集团旗下的AI理财管家,连接了蚂蚁财富平台生态内200多家基金公司、券商和财经媒体的内容与服务。在通用大模型的基础上,“蚂小财”技术团队还搭建了一套金融智能增强的技术体系,实现了金融场景内专业功能、交互体验的全面增强。

“金融领域是国内AI技术应用的焦点场景之一,但天然也对AI的专业性、严谨性等能力提出更高标准。目前国内AI在金融领域的表现逐渐提升,不断从“博闻强识”走向“专业审慎”,为下一阶段大规模应用打好了基本盘。”测评团队负责人、上海财经大学教授张立文表示,这些“AI+金融场景”的积极稳妥探索,有助于在国际AI产业竞争中保持领先身位,也将打开我国数字金融、普惠金融建设的新局面。

  • 胡塞武装称袭击以色列多处目标,致其“航班中断”|界面新闻 · 快讯
  • 荣耀发布折叠屏新机,等待苹果入局|界面新闻 · 科技
  • 李国庆与俞渝三家共同持股企业拟注销,此前曝双方财产纠纷已和解|界面新闻 · 科技
  • 南京华新大厦今年夏季将不开启中央空调,物业:按照少数服从多数原则|界面新闻 · 地产
  • 2025世界机器人大会观察:机器人越来越强,集体“找活干”|界面新闻 · 科技
  • 美国阿拉斯加地震引发局地海啸,我国沿岸不受影响|界面新闻 · 天下
  • 俄发现失联安-24客机碎片:第二次试降时失联,飞机机龄约50年|界面新闻 · 快讯
  • 美国得州洪水死亡人数升至80人,白宫否认联邦裁员影响预警|界面新闻 · 天下
  • 【观察】科技引领中国供应链新方向,中美合作仍是大势所趋|界面新闻
  • 基本面 | 央行连续14月超额续作MLF,利率不变|界面新闻
  • 伊核设施是否被摧毁?特朗普政府、媒体与联合国机构又吵起来了|界面新闻 · 天下
  • 财政部:1-6月全国国有及国有控股企业营业总收入同比下降0.2%|界面新闻 · 快讯
  • 汽车早报|广汽预计上半年由盈转亏 特斯拉正式进军印度市场|界面新闻 · 汽车
  • 年内股价下跌72%、国资入主“告吹”,*ST汇科拿什么自救?|界面新闻 · 证券
  • 对话联想创投王光熙:具身智能行业估值有泡沫,需要一两年消化|界面新闻 · 科技
  • 发布评论 0条评论)

    还木有评论哦,快来抢沙发吧~