ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

李飞飞-大佬成长史

李飞飞-大佬成长史 问你一个问题提到李飞飞你最先想到的是什么我想 99% 的人会说是 ImageNet。其实在 AI 领域一般提到某个人你首先想到的都是他的代表作。比如说提到 Yann LeCun你首先想到的是 CNN提到何恺明你首先想到的就是 ResNet。这些都是算法类的就是 AI 的一些里程碑式的贡献。但是为什么提到李飞飞你首先想到的却是 ImageNet 呢ImageNet 可不是一个算法上的贡献它只是一个数据集。【而且不止一个三个数据集横跨 13 年】而且这还不止一个。2004 年博士期间Caltech 101。2009 年助理教授期间ImageNet。2017 年拿到终身教职之后Visual Genome。横跨 13 年横跨三个职业阶段每一个阶段她都在做数据集。所以这就不是运气的问题了这是战略选择。她从博士生开始就已经做出了这个选择。【自我介绍大佬是如何发育起来的】大家好这里是生信之灵。我们这个系列做的是大佬的成长史。我们想做这个系列就是想通过大佬的成长历史来学习大佬是如何发育起来的以及对我们博士生有什么能够参考借鉴的。那么这期内容我们就来探索一下李飞飞是如何通过 ImageNet 名声大噪的或者说她是如何打造 ImageNet同时让自己声名远播的。【李飞飞是谁】李飞飞美国国家工程院、国家医学院、艺术与科学院三院院士Google Scholar 总引用量超过 36 万次。她出生于北京后在四川成都上学16 岁随母亲赴美与父亲团聚。1999 年在普林斯顿大学完成了物理学学士学位2005 年在加州理工学院完成了电气工程博士学位。2007 年加入普林斯顿大学计算机科学系任助理教授。ImageNet 就是在这一任上启动的。【ImageNet 和 AlexNet互相成就】ImageNet 是一个包含了 2.2 万个类别、1400 多万张图片的数据集。2012 年 AlexNet 的出圈引爆了整个 AI 领域同时 ImageNet 也是 AlexNet 真正发挥自己能量的一个非常合适的场地。可以说如果没有 ImageNet或许 AlexNet 无法做到这么出圈、这么惊艳。然后 AlexNet 的火爆同时也引爆了 ImageNet让它成为后边大家都在互相打竞赛的一个比赛场地、比赛数据集。【2007 年她受到的全是冷遇】2007 年她那时是普林斯顿的助理教授刚站稳脚跟然后想去制作一个大型的数据集。当然站在我们现在这个时间的角度来看ImageNet 做得其实非常成功。但是在当时也是受到了许多冷遇。其实像申请资助的时候普林斯顿的资深同事劝她说不要做这种东西说对一个初级教职来说太冒险了。然后连基金申请也是多次被拒。其中广为流传的一条是某次评审意见称这个提案唯一的可取之处是申请人是女性。当时学界的普遍态度李飞飞自己也讲过就是 ImageNet 之前学术界的共识Pre-ImageNet, people did not believe in data在 ImageNet 之前没有人相信数据。然后也有人质疑就说如果你连一个物体都做不好为什么要去做几千几万个物体以及 2007 年这个项目启动后一位资深同行对她说的话I think youve taken this idea way too far我觉得你把这个想法推得太远了。【八条机制】那么 ImageNet 是如何发展并做大做强的呢我总结了 8 条机制。【机制一地基不一定要自己造】地基并不一定要自己造而是可以借来的。首先它并没有定义世界上有哪些物体类别而是直接套用了普林斯顿做了 20 年的 WordNet 语义层级树。其实它跟图像一点关系都没有。WordNet 是普林斯顿大学的认知心理学家乔治·米勒在 1985 年牵头做的一个英语词汇数据库它是按意思把词组织起来然后把同义词打包成一个同义词集。WordNet 大约有 11.7 万个同义词集其中名词占大概 8.2 万个左右。而认知心理学家欧文·比德曼估计人类可辨识约 3 万个物体类别这是 ImageNet 类别规模的心理学依据。最终李飞飞确定了 2.2 万个同义词集作为图片的类别。【机制二劳动力不一定要自己雇】第二劳动力不一定要自己雇佣。因为她发现如果让本科生来标注这个数据集的话按当时的估算需要十几年以上。然后她直接外包给了亚马逊 Mechanical Turk约 4.9 万名工人、167 个国家费时两年半从 1.6 亿张候选图片筛选到 1400 万张。当然真正值得讲的是并不是完全外包给别人就可以无忧了而是说她给 Turker 的行为建了统计模型做质量控制。因为众包的死穴是质量这样她就把质量控制本身变成了一个可计算的问题。【机制三不要另起炉灶可以借力】第三就是不要另起炉灶完全可以借力。就是本身 ImageNet Large Scale Visual Recognition Challenge也就是这个 ILSVRC它并不是凭空办起来的。早在 2005 年就举办了 PASCAL VOC 竞赛它才是用年度赛事标准化算法评测这个范式的发明者。而 ILSVRC 2010 到 2012 这最关键的三届是 PASCAL VOC 的组织者和 ImageNet 的组织者联合举办的。这意味着她在举办竞赛的时候面对的不是一个空房间而是一个已经举办了 5 年、已经有了一定听众和信誉的会场。因为一个新的基准最难的从来不是造数据是冷启动——就是没人来打榜那么榜单就没有意义榜单没有意义那就更没人来打榜这就形成了一个死循环。所以她并没有直接建立权威而是借助了相关领域的力量。就是说你没必要自己从头搞完全可以借助外部的力量。【机制四大幅降维2.2 万类砍到 1000 类】机制四就是大幅度的降维从 2.2 万类砍到 1000 类。因为 ImageNet 的全量有 2.2 万类图片约 1400 万ILSVRC 竞赛的话是类别砍到了 1000 类图片约 120 万。其实造数据要求全办比赛时要求可比两套完全相反的逻辑同时执行。因为就我个人观点你只有把这个数据集做得让更多的用户能够参与进来它才有意义。2.2 万类它是给世界的完整性用的它服务于一个愿景然后 1000 类是给参赛者算得动、结果排得出来用的它服务于传播。要是比赛直接上 2.2 万类2010 年没有一个团队跑得动那么这个比赛第一年就死了。就是一个基准要传播必须先把自己做小做简单。因为大家的设备水平都不一样跑完整数据集的代价太大了那么可以创建一个更小的数据集用于引流。其实有点像自媒体的那种引流方式——也不一定是自媒体就是一些吸引人的方式前期设一个小的东西后期再把人引到大的那个东西上去。【机制五一个数字top-5 错误率】机制五一个数字top-5 错误率。它不是一组指标也不是一个雷达图而是一个可以排序、可以上新闻标题、可以写进摘要的单一数字。数字简单它本身就是一个更好的传播物。也正是因为数字简单2012 年 AlexNet 突破了极限一个数字直接就火出圈了。同时我觉得也是方便圈外的人去了解这个行业。你不需要花太多心思去搞清楚这个 metric 是怎么算的、怎么搞的只需要看一个简单的数字就知道这个东西的好坏。不一定是本圈内的人也可以让普罗大众知道这个事情。我觉得还是简化了传播——越简化的东西越容易传播。【机制六零门槛发放】机制六就是零门槛发放。数据全量公开、免费、无需申请任何人都可以下载任何人都可以参赛。其实这和第四条、第五条是类似的便于使用的核心目的还是易于广泛传播。【机制七年度仪式】机制七就是年度仪式。它每年都会有固定时间、固定会场然后固定的排行榜公布形式连续了 8 年。因为基准的一个权威不只是来自于它有多准同时还来自于它有多定期。一年一次连续 8 年它就从一个数据集变成了这个领域的年度大事这是一件没人能够忽略、每年都发生的事情。同时每一年也都在吸引更多的人来参赛然后持续地扩大生产、扩大影响力。因为你知道像我们之前法比安那期的分析就是很多时候一些科研项目它的长尾收益是非常恐怖的。当然也有点类似于你像法比安他们是有社区经理的常年维护社区活跃度。其实像李飞飞她们搞这个 ImageNet benchmark每年举行赛事本质上也是一种维持整个领域社区活跃度的方式。【机制八稀释所有权】机制八就是稀释所有权。ILSVRC 的组织者名单里有 12 个人2017 年收官之后数据集还移交给了 Kaggle 托管。就是她不断地把这个基准的所有权往外交看起来是放弃控制实际上让更多的机构共管、最后托给第三方才是一个领域的公共设施。而公共设施的引用是永久的。这其实和法比安把 Scanpy 这些算法库托管给一些公共基金本质上是一回事——看起来是稀释了自己的权力但其实获取了更大的权力。同时还要有利他性你要尽可能拉更多的人参与进来才能把这个事发展壮大。顺便提一句她 2015 年还在斯坦福开了那门计算机视觉入门课这也是在攒声望跟吴恩达干的是同一类事。关注我后边我们就讲吴恩达。【生信里的对照scIB 和 Open Problems】那么在生信领域像法比安他们组发的那个 scIB它是一次性的而且论文发表的时候榜单就已经定了它不是一个长期活动的比赛项目。那么正好 Open Problems 补上了这一层。它是由 50 多家机构参与的然后 12 个任务有自动化的测评流水线并且驱动了 NeurIPS 的年度竞赛。然后他们用的词是 living benchmark是个活的基准。所以其实说实话以前李飞飞 2007 年做的这个事是在数据不被信任的年代逆共识下注赔率极高。当然代价是基金被拒、被劝退。但是今天已经没有任何人会怀疑基准的价值共识已经反过来了。但这也同样意味着大家已经意识到这其中的潜在收益所以现在许多大机构组团开始下注这类方向。 我本来对这个方向挺悲观的但是我去open problems看了下我发现好像这么多benchmark也没多少人来打榜啊你看算法就几个其中还有baseline我又感觉我们个体博士生其实还有机会呀【但对博士生依然有三点参考】但是这依然对我们博士生是有一些比较好的参考意义的。第一点反过来说你现在去做一些基准数据类的工作就不需要再花费大力气去说服别人这件事为什么值得做了。等于说做这件事的门槛其实是降低了的。第二条启示就是没必要另立门户完全可以借助已有的各种 benchmark、挑战和比赛。现在这类比赛非常多挂靠位反而也变多了。同时也可以挂靠已有的本体或者是标准就不用自己去定义一些标签体系不仅可以省掉大量的工作量更解决了“凭什么你说了算”这个问题。就是完全可以借助外部力量去扩大自身。第三点就是运营者也能拿到职业收益。比如机制八里组织者名单里的 12 个人像邓嘉现在已经是普林斯顿的教授他不是 ImageNet 的发起人只是执行者还有 Olga Russakovsky现在也是普林斯顿的教授也是 ILSVRC 的主要负责人之一。所以对于博士生来说就算自己不是创始人也完全可以深入一些相关 benchmark 的运营去做一些平台维护之类的工作也是可以分到收益的。因为垄断是对创始人的垄断不是对运营者的垄断。机器越大越需要有人来维护它维护它的人也是可以拿到真实职业收益的。【两个坑不要踩】做这类项目的话还有两个要注意的坑不要踩到。一个就是如果你是发布者的话你尽量不要直接去当挑战者。如果你既当裁判又当运动员这个吃相就有点太难看了。因为benchmark 唯一的资产是可信度既当裁判又当运动员这个问题跟你做得好不好完全无关而是大家一开始就不信任你做的这个 benchmark 了。第二个坑就是基础设施是纯成本所以它只能是主线的副产品。像写文档、维护 benchmark其实这些在考核表上是一分都不算的相当于你付出了很多时间但在这方面的收益是没有那么高的。所以坑就坑在你不能拿它当主线。而且说实话长期的维护并不能让你再发表一些新的论文——它带给你的不是论文是名望。【收尾她做对了所有能做对的事】开头我说这不是运气是战略选择。但战略对不等于就能成。ImageNet 的成功还是离不开巨大的运气成分。因为 2010 年冠军 top-5 的错误率在 28.2%它是传统方法然后 2011 年错误率是 25.7%也是传统方法仍然没有深度学习参赛。两年只进步了 2.5 个百分点其实并没有多大的进步。那两年只有做计算机视觉的人知道这个 ILSVRC 是什么圈子外面没有任何人在乎。那两年里ImageNet 和一堆没人下载的数据其实没有任何区别。所有质疑它的人在那两年里看起来都是对的。2011 年她已经在这件事上耗了四年。经费被拒过资深同事劝过她别做同行当面跟她说你把这个想法推得太远了。她把这些全扛下来了然后办了一个比赛办了两年几乎什么都没发生。她能做的只有一件事就是让这个比赛明年再办一次。直到 2012 年AlexNet 横空出世直接把 top-5 的错误率打到了 15.3%领先第二名 10.9 个百分点获得了巨大的进步。如果说 AlexNet 晚几年发表这个竞赛大概率已经因为没人参赛而停办了。那么 ImageNet 最终就会成为一个反面案例一个雄心勃勃、但是被证明方向错误的项目。她做对了所有能做对的事情然后等到了那个正确的人。我做这一期不是想说你也能成为李飞飞。那个概率太低了低到讲出来都不负责任。我想说的是另一件事。2011 年她没有任何办法证明自己是对的。所有人都觉得她做错了而且从当时的数据上看所有人都没说错。她那时候唯一能做的就是把这件事再做一年。在 2012 年到来之前没有人有资格说她是对的。包括她自己。所以如果你现在手上也有一个没人看好、看不到头、连你自己都动摇过的东西那你现在就在 2011 年。再做一年
返回列表