汇通财经网

最新评测对主流大模型幻觉问题进行了评估

  如何准确评估和解决大语言模型中的幻觉问题已成为一个至关重要的挑战。近日,复旦大学与上海人工智能实验室构建了针对中文大模型的幻觉评测数据集HalluQA,对业界主流的大模型进行了评估。

  HalluQA采用无幻觉率来评估大模型的优劣。无幻觉率越高代表模型幻觉越低,事实准确性越高。在评测的24个主流大模型中,包括百度文心一言ERNIE-Bot、百川Baichuan、智谱ChatGLM、阿里通义千问和GPT-4等。

  从评测结果来看,幻觉问题对大模型来说尚有困难,有18个模型的无幻觉率低于50%。在幻觉消除上,具备检索增强能力的大模型优势明显,在所有模型评测中,文心一言在整体幻觉问题解决方面表现突出,排名第一,整体无幻觉率为69.33%。

  行业普遍认为,幻觉问题对于大模型在多个领域的落地都可能产生影响,包括客户服务、金融服务、法律决策和医疗诊断等。因此解决幻觉问题越好的大模型,才具备更强的产业落地价值。

【纠错】 【责任编辑:凌纪伟】 阅读下一篇:
    深度观察

            推荐阅读:

            巴蜀明灯:四川联通服务一线的闪亮

            2023年10月19日乙二醇价格行情今日报价查询

            小猪佩奇的原型不是猪?这位博士讲的知识太冷了!

            2023重庆创投大会开幕 创投机构汇聚山城 剖析科创及产业发展机遇

            (2023年10月31日)今日乙二醇期货最新价格行情查询

            我国力争2025年初步建立“以竹代塑”产业体系

            菜鸟连续七年做快递包装回收 数字化优势助力物流减碳

            2023年11月6日今日现货乙二醇最新价格多少钱一吨

            技术筑生态 智联赢未来,第二届OpenHarmony技术大会举行

            2023华为云西北渲染中心生态大会在甘肃庆阳举办

            相关推荐