常识推理新突破!认知智能国家重点实验室荣登CSQA 2.0榜首

发布于: 雪球转发:1回复:0喜欢:0

4月12日,由科大讯飞承建的我国首个认知智能国家重点实验室,以76.06%的成绩登顶常识推理挑战赛CommonsenseQA 2.0,刷新世界纪录,在让机器“能理解、会思考”上迈出一大步!

CommonsenseQA 2.0是艾伦人工智能研究院(Allen Institute for AI)于2021年主导发布的国际常识推理评测数据集,旨在评估机器对常识知识的理解及掌握水平,吸引了包括 Google、Allen Institute for AI、华盛顿大学等众多国际顶尖机构参与挑战。 科大讯飞首次参赛,即创新性地提出ACROSS模型,以全新深度学习算法绝对优势,刷新机器常识推理水平世界纪录。

从做“选择题”到做“判断题”机器学会常识推理有多难?

常识推理(Commonsense Reasoning)是 NLP 最重要的前进方向之一,其目的是帮助 计算机学习常识知识,并利用所掌握的知识进行深层次的理解及推理。该领域的进展及技术突破对人工智能发展具有重要的意义。

当前典型的阅读理解模型所关注的问题类型主要是事实类问题,这类型的问题答案往往能直接在原文中找到,然而如何基于常识和背景知识进行推理以获得答案仍旧是一个巨大的挑战。

CommonsenseQA正是为了训练机器像人类一样基于先验知识结合现实情况作答能力而设置的数据集。当人们回答问题时,往往会利用自身了解的知识结合特定的背景来判断问题答案,比如常识、背景知识、空间关系、科学事实、社会惯例等。

CommonsenseQA 1.0任务示例

如上图任务示例中的第一个问题,“我可以站在河上的什么地方看水流而不会弄湿自己?”可以从选择项中推断我是在桥上。这种知识对人类而言似乎很好理解,但是如何让机器学会常识及背景知识并进行准确推理,仍然是一个巨大的挑战。

CommonsenseQA 2.0是一个二元分类数据集,包含14343个问题,主要分为训练/开发/测试集,需要判断常识性陈述是对还是错。1.0版本所考察的问题,是基于现有常识知识库ConceptNet中的知识三元组构建的,这使得机器在处理该任务时,有能直接聚焦参考的知识。相比较1.0的“选择题”,2.0“判断题”挑战难度更高,仅给定一个主题实体或概念、一个常识类关系(且关系不一定在现有知识库出现),让人类以自然语言的方式去构造机器较难掌握的常识知识。

该构造方法所构造的常识推理问题具有庞大的想象空间,大部分在当前知识库中并未覆盖,无疑显著增加了机器处理该类问题的难度。同时,该评测任务数据构造过程中,还通过人与机器不断博弈对抗的方式,不断迭代设计,最终确定的问题集合基本是当前主流算法都完成得不好的问题。

CommonsenseQA 2.0任务问题示例

CommonsenseQA 2.0任务所覆盖的常识问题类型示例

目前以 科大讯飞为代表的中国人工智能力量在常识推理领域中已有很大的进步,但是仍远低于人类94.1%的水平,可见在常识性推理方向仍有很大挑战和进步空间。

科大讯飞提出ACROSS创新方法破解难题

在CommonsenseQA 2.0这项颇具挑战的常识推理评测任务上,业界主流的中等大小预训练模型方法也只能取得55%的水平,略高于随机猜测平均水平。此前国际上该任务的最优方法,通过1750亿级参数量大小的GPT3模型生成针对CommonsenseQA 2.0常识推理问题的相关知识,并基于T5模型进行融合处理,该方法取得了73%的准确率。

本次由 科大讯飞承建的认知智能国家重点实验室团队创新提出的面向常识知识推理的ACROSS(Automatic Commonsense Reasoning on Semantic Spaces)模型,是继2016年科大讯飞提出神经联想模型NAM(Neural Association Model),并取得Winograd Schema Challenge冠军后的又一力作。

该模型实现了统一语义空间下外部知识的有效融合,显著改进了超大规模预训练模型所存在的问题,在CommonsenseQA 2.0任务上取得76%的准确率。

该评测的常识推理问题,不论在ConceptNet等知识库,或者互联网上,都较难找到直接的答案。从人类进行常识知识运用及推理的习惯出发,对于一个复杂的问题,首先需要查阅相关知识库或典籍,其次会借助互联网搜索去查找相关信息。ACROSS模型正是借鉴该思路,充分收集知识库、互联网相关信息,在统一的语义空间中进行融合处理,最后赋予超大规模预训练模型更强的知识输入,实现准确的常识知识推理。该方法结果也一定程度上证明了机器已初步具备对于各类复杂文本信息及知识的深入理解及运用能力。

我国在常识推理领域的技术攻坚还在继续。人工智能技术的下一步发展,必须要突破常识推理这一瓶颈,才能在教育、医疗、养老等国计民生场景中,让人工智能产品更具备实用价值。“让机器能听会说、能理解会思考”是清晰可预见的未来, 科大讯飞求索未止。

聚圣源唱歌的艺名应该怎么起八卦公司起名大全太古剑尊饭店电脑起名心如止水是什么意思机械厂起起名大全人力资源公司起名字大全免费谈古论今写给学校起个名字新新漫画免费起名字打分100分吗宝宝起名男孩牛姓北京tv4个字木业公司起名大全60万日元等于多少人民币寓意好的成语起什么名字好女孩带佳字起名金融公司起名大全字库属相鼠的男宝宝起名2020宝宝起名字金榜起名打分网取名字大全2013高速公路里程查询金牛座男人柯洁大人的防具店自怨自艾天才高手属虎的宝宝起名字网上起名真的吗淀粉肠小王子日销售额涨超10倍罗斯否认插足凯特王妃婚姻让美丽中国“从细节出发”清明节放假3天调休1天男孩疑遭霸凌 家长讨说法被踢出群国产伟哥去年销售近13亿网友建议重庆地铁不准乘客携带菜筐雅江山火三名扑火人员牺牲系谣言代拍被何赛飞拿着魔杖追着打月嫂回应掌掴婴儿是在赶虫子山西高速一大巴发生事故 已致13死高中生被打伤下体休学 邯郸通报李梦为奥运任务婉拒WNBA邀请19岁小伙救下5人后溺亡 多方发声王树国3次鞠躬告别西交大师生单亲妈妈陷入热恋 14岁儿子报警315晚会后胖东来又人满为患了倪萍分享减重40斤方法王楚钦登顶三项第一今日春分两大学生合买彩票中奖一人不认账张家界的山上“长”满了韩国人?周杰伦一审败诉网易房客欠租失踪 房东直发愁男子持台球杆殴打2名女店员被抓男子被猫抓伤后确诊“猫抓病”“重生之我在北大当嫡校长”槽头肉企业被曝光前生意红火男孩8年未见母亲被告知被遗忘恒大被罚41.75亿到底怎么缴网友洛杉矶偶遇贾玲杨倩无缘巴黎奥运张立群任西安交通大学校长黑马情侣提车了西双版纳热带植物园回应蜉蝣大爆发妈妈回应孩子在校撞护栏坠楼考生莫言也上北大硕士复试名单了韩国首次吊销离岗医生执照奥巴马现身唐宁街 黑色着装引猜测沈阳一轿车冲入人行道致3死2伤阿根廷将发行1万与2万面值的纸币外国人感慨凌晨的中国很安全男子被流浪猫绊倒 投喂者赔24万手机成瘾是影响睡眠质量重要因素春分“立蛋”成功率更高?胖东来员工每周单休无小长假“开封王婆”爆火:促成四五十对专家建议不必谈骨泥色变浙江一高校内汽车冲撞行人 多人受伤许家印被限制高消费

聚圣源 XML地图 TXT地图 虚拟主机 SEO 网站制作 网站优化