“中文十级”难题,AI怎样解读

2019-08-06 18:24     来源:     作者:王蔚

  在人工智能领域,“懂语言者得天下”是普遍的共识。其中,可帮助人工智能识别人类语言的自然语言处理(NLP)被誉为人工智能语言“皇冠上的明珠”。

  当人工智能自然语言处理技术遇到“要你管和不要你管”“掉地上和掉地下”“我一把把把把住了”等中文“绕口令”,“小意思”“意思意思”等多义词时,及“俺们那疙”“中不中”等方言时,该怎样“听懂”这些“中文十级”语句呢?日前在成都举办的科大讯飞未来科栈活动上,记者采访了相关专家。

  能分词会断句 机器尚在努力

  NLP就是机器让计算机来理解和处理人类自然语言的技术,它和计算机视觉、语音处理的区别在于信息处理的类型。

  “计算机视觉主要处理图像,语音技术处理声音,而NLP主要是对文字的理解。”云浮科技的创始人兼CEO张文斌说,在人工智能中,语音识别是耳朵,语音合成是嘴巴,计算机视觉是眼睛,而NLP则负责将抽象的文字符号转化为计算机能理解的语言。

  “‘中文十级’的某些语句,人类去理解都有很大难度,何况是计算机。”张文斌说,在口语和书写上,汉字往往没有词与词之间的边界,即便机器能够准确识别文字,但理解它的意思却很难;再比如各种五花八门的地方口音和方言,也是“绊脚石”。

  “自然语言处理一般从最小的语意单位‘词’开始,即分词算法。这最简单,也最成熟。”张文斌说, NLP的算法分为语法级别、句子级别分析等,其中分词就是将字词切开,让机器明白哪几个字组成一个词,哪几个词组成一句话,从而理解整句、整段的意思。但在“分词”实际的应用过程中,仍有各种问题。

  张文斌解释,首先是分词标准不确定、存在歧义,及新词和实体词困扰等问题。如“乒乓球,拍卖完了”和“乒乓球拍,卖完了”无论怎么切分都正确,这就要依赖上下文语境。其次,每年都会涌现出的网络词汇,“神马”“不明觉厉”“佛系”等原来不存在的词也需要计算机理解。

  听语气判关系 AI有新招

  如何让机器读懂上下文语境,从而进一步了解整段话的含义?

  “我们会尝试利用听人类说话时的停顿信息,作为一种分词算法的辅助。”讯飞翻译业务负责人翟吉博说。

  对于AI工程师们来说,更重要的是深层次的算法,如实体识别、属性抽取等。“就是把人名、地名、机构名等实体识别出来后,再抽取实体之间的关系,搞清楚不同实体在句子中的不同属性。”张文斌说,五花八门的算法还有很多,比如情感分析,分析文本里面蕴藏了什么样的情感,是正面、负面还是中性的;文档摘要,把长文生成一两百字简短的摘要等。而基于这些算法层,又可以做很多NLP的衍生应用,包括自动问答、机器翻译等。

  那如何识别方言呢?在科大讯飞的新款翻译机设备中,首次推出方言翻译功能,实现河南话、东北话、粤语等方言互译,或将之翻译成外语。翟吉博说,针对不同类型方言,机器采用不同翻译流程——对同属北方方言区的河南话、东北话等,可先翻译成普通话再翻译成外语;对于粤语等南方语言,则建立独立的语料库,直接从粤语到外语进行翻译。“考虑到方言中带有许多地方特色的说法、语言、词汇,‘雄起’‘中不中’等也可以作为独立的语料,由机器单独学习。”他说,人工智能的优势是在自然语言处理方面能够不断从用户处积累语料,学习新的词汇和表达方式,不断完成自身数据库和语料库的更新。

(责任编辑:王蔚)

上一篇:Open AI用强化学习算法 教会机械手“盘核桃”

下一篇:粒子物理学离不开人工智能

*免责声明: 凡本网注明“来源:XXX(非神州瞭望网)”的作品,均转载其它媒体,转载目的在于传递更多信息,并不代表本网赞同其观点和对其真实性负责。若内容涉及投资建议,仅供参考勿作为投资依据。本网站无法鉴别所上传图片或文字的知识版权,如果侵犯,请及时通知我们,本网站将在第一时间及时删除。


推荐阅读
  • AI应用场景多元化,落地与挑战中寻找产业AI化的最优解

    ​10月26日,《2021-2022中国人工智能计算力发展评估报告》(以下简称:报告)在AICC2021人工智能计算大会上发布,旨在通过宏观经济、技术成熟度、AI劳动供给、行业及地域四大方面综合考量和评估我国

    2021-11-01


  • 用AI赋能智能制造转型升级

    ​中业科技成立10余年来逐渐发展成为一家NLP(自然语言处理技术)及应用的人工智能公司,并在智能制造领域取得突破。未来是AI的天下,AI不仅能用于互联网社交,还能在物联网和制造业等领

    2021-10-25


  • 技术与场景深度融合 谱就AI大时代繁荣生态图谱

    ​锁定重大产业方向,设立以头部企业为依托的开放创新平台,让他们在国家人工智能创新体系中发挥引领作用,是国家新一代人工智能开放创新平台设立的关键诉求。 随着国家新一代人工智能

    2021-10-21


  • 着力推动虚拟现实产业高质量发展

    ​新华社南昌10月19日电 2021世界VR产业大会云峰会开幕式19日在江西南昌举行,国务委员王勇出席并致辞。他强调,要以习近平新时代中国特色社会主义思想为指导,全面贯彻党中央、国务院决策

    2021-10-20


  • 世界VR产业大会发布中国虚拟现实产业重要成果

    ​10月19日,由工业和信息化部、江西省人民政府主办的2021世界VR产业大会云峰会在江西南昌开幕。本次大会以VR让世界更精彩融合发展创新应用为主题,设立奥地利和韩国两个海外分会场,吸引

    2021-10-20


  • 传统行业想获得AI加持,为何这么难

    ​AI技术要实现应用,首先数据要达到一定的体量,此外算力也要能支持大规模的模型训练,而后算法方面需要达到一定的精度,端侧算力也要具备一定的推理能力。 之所以目前只有消费互联网

    2021-10-18


  • 山东移动九大模型助力精准“打猫”

    ​近年来,山东移动将防范打击电信网络诈骗作为我为群众办实事的具体举措,持续深化开展春雷断卡行动,推动构建清朗的网络空间环境。 今年以来,依托九大模型精准识别,山东公司已累计

    2021-09-29


  • 敲黑板啦,关于5G网络的重要提示

    ​敲黑板啦~~随着技术更新迭代,越来越多的人开始用5G手机,请注意:使用5G手机却没有打开5G开关,那用的仍旧是4G网络哦~ 这样的设置步骤,你一定要清楚明了 对绝大多数人来说,睡觉前做的

    2021-09-29


  • 2021国家机器人发展论坛在深圳召开

    ​2021年9月24-25日,以创新湾区智造,跨界融合发展为主题的2021国家机器人发展论坛在深圳隆重召开。此次国家机器人发展论坛的举办是学会积极响应中国科协关于开展科创中国品牌工作号召的具体

    2021-09-29


  • 知道创宇入选第九届CNCERT国家级网络安全应急服务支撑单位

    ​9月27日下午,第九届CNCERT网络安全应急服务支撑单位授牌仪式在世界互联网大会的互联网之光博览会举办,知道创宇创始人兼CEO赵伟等13家国家级支撑单位代表出席此次授牌仪式。 知道创宇在

    2021-09-29