那些重复的,或者碎片化的数据,对于现阶段的人工智能而言,除了能够占据一定的内存之外,完全没有半点的用处。
更加不用说,让人工智能实现新的跃升了。
特别是随着人工智能的发展,绝大多数的公司都已经注意到了数据的重要性。
伴随着版权意识增强,以及各种法律法规的落地,数据的获取难度,以及成本都在大幅度的上升!
以前的时候,那些个搞人工智能的公司,随便弄点网络爬虫,就能够从互联网上搞到海量的数据。
还有一些,直接就是从别的公司开发出来的人工智能里面,进行数据蒸馏,把人家整理好的数据拿过来自己用!
而现在呢?
大多数平台都开始通过限制网络爬虫,提高API访问费用等等方式保护数据。
而大量的高价值数据,像是医疗,金融,科研数据等等,因为涉及隐私,商业机密等等原因。
基本上就是以“数据孤岛”的形式分散存在。
想要让它们流通,成本可不是一般的高。
当然了,这些问题也不是完全没有办法解决。
高价值数据的成本高,真要是咬咬牙,愿意花本钱的话,也不是弄不到。
可问题是:某些特定领域的数据严重匮乏!
比如说,在人形机器人领域,数据短缺的问题尤为突出!
想要训练出一台具备通用能力的人形机器人,最起码需要上千万小时的多模态物理交互数据。
而截止到现在为止,全球可用的合规真实数据不超过六十万小时,缺口高达百分之九十九!
更不用说,这还只是训练具备通用能力人形机器人最基本的需求!
为什么那些个人形机器人公司,一个个的不是用编程就是用遥控器,用人工智能来训练人形机器人不香吗?
可以想象,无论是哪家公司能够做到这一点,都能够在短时间内一飞冲天!
就好像是首个发布了大预言模型的人工智能公司一样。
估值直接能够涨到天上去!
几百亿的估值基本上是唾手可得,只要是稍微发发力的话,几千个小目标估计都是不在话下。
可问题是……做不到啊!
人工智能又不是万能的,没有足够的数据进行支撑,根本就没有办法进行升级迭代!
在文本领域还好,大语言模型的框架已经拥有了一定的基础。
可是在具身智能领域,特别是多模态物
本章未完,请点击下一页继续阅读!