专访龙猫数据CTO姚毅:为AI企业提供精准数据服务

对于AI公司来讲,数据的采集、清洗、标注过程严重拖慢研发效率,耗费大量人力时间,而且数据标出来如果不规范,量不够大,难以满足专业化的应用需求。然而,每一项 AI 技术的场景应用,背后都需要海量数据的支持。所以在人工智能产业链上,专业化的AI数据服务商便应运而生。

随着AI行业的纵深发展对数据的需求量不断增加,数据服务即是根据应用方要求,利用人工为图片、视频和语音内容打标签、做标注。为AI公司用来训练算法模型,然后应用到图像识别、语音识别、动作识别、自动驾驶等不同领域。数据标注得越准确、数量越多,算法模型的效果就越好,高质量的数据标注决定一家AI公司的行业竞争力。龙猫数据就是奔驰在这个行业的一匹黑马。

“深度学习是机器学习中一种基于对数据进行表征学习的方法,表征学习的目的,是通过从大规模数据中进行学习,并不断追求更好的表示方法,即通常所说的模型。”龙猫数据CTO姚毅说。针对这样的技术特性,龙猫数据在人工智能数据业务方面做到了效率高、数量大、准确性高的特点。

姚毅介绍:“数据采集方面,性别、年龄都要控制好比例,还要考虑地域的差异。甚至采集设备的位置都会影响数据质量;数据的清洗标注环节,要根据作业的精度要求去掉不符合的数据。最后质量检测,要验证合格的数据率,不合格数据需要重走流程。”

人工智能有三大要素:计算力、算法和数据。其中数据是人工智能的基础,数据量越大算法的效果越好,使得企业可以实现一些过去只有人能够做的事情,因此数据是人工智能的前提。据姚毅介绍:“龙猫数据对客户在数据采集和标注领域提出的需求由技术团队提供定制化服务,旗下拥有的众包平台龙猫众包,包括移动端APP、PC端标注网站等提供精准的数据采集及标注。”姚毅表示,目前龙猫众包用户量达到四百余万,可承担千万人以上样本量,是国内可调动数据处理人员最多、结果最精准的 AI 数据服务平台。

在采访中姚毅不止一次提到在数据采集和标注中“精准”对AI客户的重要性,龙猫数据的精准和极致又是如何做到的?因为数据具有体量大、多样性、价值密度低、速度快等特点。所以“精准”取决于数据样本的数量与质量。龙猫数据不断的采集、标注、清洗、存储等方式快速获取有价值的数据和信息,积累大量数据集与数据样本,为人工智能机器的深度学习。因此,人工智能产品精准的识别度需要大量的数据样本支持其计算机进行深度学习、训练。换句话说,龙猫数据“精准”的数据是人工智能产品研发结果的核心要素!

姚毅认为在人工智能行业快速发展的前提下,以深度学习为代表的算法在诸多领域被逐渐应用,对优质数据,尤其是优质一手数据的需求量快速增长。当前,这些“有价值”的数

据往往很难依靠市场上的“公开数据”获取,因而为做AI数据服务的公司提供了新的市场机遇。

据了解龙猫数据成立于2014年,是一家专业的AI数据服务公司,致力于为整个AI领域提供最专业的数据服务。龙猫数据经过三年的发展已经成为国内AI数据主要的服务商,受到业界广泛的认可。创始人CTO姚毅毕业于浙江大学 计算机系工学硕士,多年技术开发及管理经验。创业前曾就职于 Google、中兴、点心、豌豆荚等公司。2010年作为第一批工程师加入创新工场,成为点心OS团队创始团队成员。2012年加入豌豆荚,领导好友系统及游戏 SDK的开发,使好友系统积累上亿条用户数据,SDK 嵌入一千多款游戏。

高质量的人才创造高质量的技术,高质量的技术提供高质量的服务。用模块化的思路打造平台,实现能够快速匹配用户需求的共享数据平台。带着这个理念与逻辑详细龙猫数据在未来的发展道路上一定会更快更稳,创新科技!

极客网企业会员

免责声明:本网站内容主要来自原创、合作伙伴供稿和第三方自媒体作者投稿,凡在本网站出现的信息,均仅供参考。本网站将尽力确保所提供信息的准确性及可靠性,但不保证有关资料的准确性及可靠性,读者在使用前请进一步核实,并对任何自主决定的行为负责。本网站对有关资料所引致的错误、不确或遗漏,概不负任何法律责任。任何单位或个人认为本网站中的网页或链接内容可能涉嫌侵犯其知识产权或存在不实内容时,应及时向本网站提出书面权利通知或不实情况说明,并提供身份证明、权属证明及详细侵权或不实情况证明。本网站在收到上述法律文件后,将会依法尽快联系相关文章源头核实,沟通删除相关内容或断开相关链接。

2018-07-27
专访龙猫数据CTO姚毅:为AI企业提供精准数据服务
对于AI公司来讲,数据的采集、清洗、标注过程严重拖慢研发效率,耗费大量人力时间,而且数据标出来如果不规范,量不够大,难以满足专业化的应用需求。

长按扫码 阅读全文