如何运营一家标注公司(市场结构篇)_第1页
如何运营一家标注公司(市场结构篇)_第2页
如何运营一家标注公司(市场结构篇)_第3页
如何运营一家标注公司(市场结构篇)_第4页
免费预览已结束,剩余1页可下载查看

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

1、精品文档如何运营一家标注公司(市场结构篇)随着 AI 浪潮的斩头露角,数据标注行业也犹如雨后春笋般蓬勃的发展起来。本文就目前国内数据标注行业存在的几个阶段性结构特征进行展开,让更多想了解数据标注的AI 公司、 AI 实验室、准备加入数据标注的朋友们,快速熟悉目前数据标注行业的现状和运营数据标注公司应该注意的若干问题。数据标注市场目前有下面几种结构:一、众包结构顾名思义,就是把需要完成的任务分发给大众志愿者(也就是市场上说的兼职) 。这其中就出现了众包公司。 众包公司联系到需求数据标注的客户,和客户建立合作关系后,将客户需求传达给合作的大众志愿者,从而形成一个“需求公司数据标注众包公司多个大众志

2、愿者”这样一个众包结构 。这种众包结构的优点就是可以组织起社会上的大众志愿者进行数据标注,而大众志愿者不用占用太多的公司资源,劳动力成本相对较低。对于数据标注众包公司费用支出的核心人工来说,无疑是可以极大的减少公司的运营成本,从而使公司自身在面对需求数据标注的客户时的报价更具有竞争力。1欢迎下载精品文档当然,众包结构的缺点和优点一样显而易见,甚至可以说它的缺点已经慢慢的大过了它的优点,为什么这么说呢?1.需要拥有大量的志愿者基数由于上游客户的需求可能千变万化, 同时客户的需求很大概率都是阶段性的,这就要求众包公司合作的大众志愿者首先自身得是稳定的。但是由于大众志愿者就是利用闲散时间进行工作的这

3、种特性, 长期稳定的大众志愿者几乎不太可能,这就要求数据标注众包公司必须拥有庞大的大众志愿者团队,形成一个体系。 才能保证在发放任务的时候总是有充足的大众志愿者进行合作。2.沟通成本高昂而当大众志愿者的数量能够满足任务要求时,我们又不得不面对另一个事实: 数据标注众包公司在与需求公司洽谈合作时只能有针对性的进行数据标注类型的选择。如果在选择数据标注项目上普遍撒网,就会面对公司自身需要投入巨大的精力去培训那些不断更迭的大众志愿者。而很多时候公司在大众志愿者合作方面节约下来的成本,其实已经全部转嫁到了公司培训、纠错诸如此类的沟通环节。3. 数据保密困难 目前国内的 AI 公司, AI 实验室还没有

4、形成井喷之势。但就现阶段而言依然有众多AI 公司,AI 实验室在进行着高度重叠的产品研发。对于有标注需求的公司来说,如果被标注数据都是真金白银获取。2欢迎下载精品文档来的,那么倘若在众包环节众包公司处理不当,很有可能 AI 公司辛苦获取的数据就成了其他AI 公司的嫁衣。4. 无法给予需求公司灵活的服务因为大众志愿者拥有流动性的特点, 一旦需求公司改变原有标注需求,数据标注众包公司是没有办法在较短的时间进行调整的。同时,数据标注众包公司的客户群体也相对单一,由于大众志愿者的群体特点,数据标注众包公司只能把更多精力放在需要大批量数据标注,同时标注规则相对简单的需求公司。 但是 AI 的训练是一个阶

5、段性的过程,基本上都是:小批量找特征训练 较小批量简单场景训练 较小批量复杂场景训练大批量训练。在数据标注众包公司砍掉处在第一阶段的AI 公司和AI 实验室的时候,其实也就是砍掉了相当一部分潜在客户。二、工厂结构有了众包结构里的兼职架构,下面就着重介绍一下全职架构,也就是工厂结构。工厂结构相较于众包结构形式上要简单一些,省去了中间众包商这个环节, 进而形成了一个 “需求公司 数据工厂”这样的工厂结构。相较于数据众包公司,数据工厂的优点就是标注人员稳定,能做到需求方和数据标注方即时沟通,沟通成本大大降。3欢迎下载精品文档低。同时,由于数据是以一对一的形式进行传递的,也大大降低了数据被泄露的可能性

6、。虽然工厂结构可以有效的规避很多众包结构中存在的种种问题,但是依旧有很多问题他是没办法解决的,那我们就看看有哪些问题工厂结构解决不了呢?1.选择标注公司的困难 在市场上可能有成百上千个工厂结构的数据标注公司,但是有数据标注需求的公司应该如何选择呢?如果没有选择正确的标注公司,不仅得不到高质量的标注数据,更有可能因为数据大批量不合格而重复返工,进而耽误了原本项目的工期。而在这个AI 公司百家争鸣的时代,时间才是最重要的,谁的产品最先出世, 也就最有机会获得资本的垂青。但是有标注需求的公司如何在众生百态的标注市场中选择一个质量和效率双重过硬的公司其实是一件非常困难的事情。2. 工厂结构公司两极分化

7、 因为各种各样的原因, 工厂结构的公司两极化很明显: 较大的可以达到上千人; 而较小的,只有几个人。 因为两级分化的原因, 市场现在就会出现一个很有意思的现象:大的公司很少会去对接短期且数据量较少的项目,因为承接较少的数据量对于一个较大的工厂结构的标注公司来说很有可能都不够公司日常的管理运营成本; 反之,小的标注公司可以。4欢迎下载精品文档承接短期数据量较少的项目,但是在大批量数据杀到的时候,又会显得捉襟见肘,难以承接。3. 人工成本风险较高 首先因为是全职, 不论有没有任务,都涉及一个员工薪酬的发放。 其次,需求方公司的需求有大概率是呈周期性的,就是有可能这周公司有项目做,下周可能就没有了。 这就会映射出一个工厂结构的数据标注公司非常尴尬的处境:合同期限内需要完成的大项目可能需要大量人员进行参与。可是一旦合同结束了,公司却又没有找到后续能够进行人员分配的项目,这就会给数据标注公司的运营带来挑战。三、众包 +工厂结构有了众包和工厂结构的总结,我们不难发现,他们各有各的优点, 也各有各的缺点。 这里提出的众包 +工厂结构,其实就是将两者进行了优缺点的融合,扬长避短。那么大家肯定会有疑问,怎么

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论