← 返回文章

从 90 条线索到 63 条核心样本:我是怎么做一张创业地图的

90 条线索到 63 条核心样本:纳入标准、单列不删、拒绝计算的数、两道自检。

第一个口径陷阱在单位:条,还是家。8 月 31 日我发了《一疆落,万物生》,讲大疆前员工创业地图;那篇的统计单元从头到尾是「条」,一条可以是公司、品牌或创业项目,所以这篇说 63 条核心样本,不说 63 家公司。没讲的部分这篇补上:90 条怎么来、凭什么砍到 63 条、哪些数我算了、哪些我拒绝算。

地图底稿是一张可筛选宽表(在线版),90 条原始线索。动手统计前最先暴露的问题:原始 HTML 的页面标题写「72 家」,程序读出的数据数组是 90 条,正文说明也是 90 条。发布任何总数之前,先确认数据里到底是多少。

一、线索从哪来:三路渠道,四轮扒完

调研存档的方法是三路交叉:科技与财经媒体报道(36 氪、雷峰网、虎嗅、界面、财联社等);投资机构渠道(红杉、顺为、高瓴、经纬、奇绩、线性、五源、蓝驰、李泽湘系基金的公众号与官网 PR);人物维度(大疆历任高管、产品线与技术负责人逐一追踪去向)。发社媒前又补了公司官网和招聘信息两个来源。线索分四轮扒完,每条带来源链接和可信度标注(确认/存疑)。

渠道本身决定样本偏向谁,放最后一节讲。

二、90 到 63:27 条为什么单列

核心样本的纳入标准只有一条:具名创始成员,有可辨认的大疆正式研发或业务经历(含北美分公司)。不满足的 27 条单列,每条写明理由:

单列原因 条数 例子
极短任职 1 宇树:约两个月试用期,不能据此谈「大疆培养」
官方分拆 3 卓驭、Amflow、Avinox
顾问或学术合作 4 硅羽、大道智创、速腾聚创、一清创新
关联公司履历 1 丰疆:招股报道表述为「大疆关联公司首席科学家」
关系待核 3 深研生物、未来智友、沃玩科技
创始人未具名 4 Farseer、爱克斯、超维无际、Dnsys
只有团队成员关系 4 珞博、诺因、ZuzuZoos、VLAI
实习或实习加团队关系 2 BRINC、蓝色涌现
公司主体未具名 2 两个只有创始人名字的项目
证据仅第三方档案 3 Cresta、RSI、OPUS

工龄有没有门槛:没有,标准只看关系的性质——正式任职、顾问、实习、分拆各归各;全表唯一定量处理的是宇树那两个月。原表的分层标签要不要信:不完全。T5(证据最弱一层)里的 R-Zero、Hangar、Fairmart 找到具名创始身份的补充材料,照样进核心样本;T1–T4 里也有顾问和未具名条目被单列。标签给排序,逐条审计给结论。27 条全部保留在表里,去掉的只是「混在一个数里数」的做法。

三、算出来的数,和它们的编码规则

四个统计模块:赛道分布(消费硬件 17、机器人/具身 13、无人机/低空 8、软件/AI 8、出行载具 7、制造工具 5、传感器 3、影像光学 2);负责人背景(30/63 条有明确的大疆部门、团队或业务负责人经历,47.6%);创办时间(可归组的 58 条里 27 条创办于 2024 年以来,46.6%);融资阶段分两个口径(全部 63 条核心样本里 36 条处在种子、天使或 Pre-A,占 57.1%;2024 年以来创办的 27 条里 23 条,占 85.2%)。

每个数字背后有编码规则,否则同一个词会数出两个结果。「负责人经历」的规则:只认明确的大疆部门、团队或业务负责人;仅工程师、仅产品经理头衔、只在后续雇主当过负责人的不计入;影微创始人只记载「芯片团队创建者之一」、管理职责不明,也不计入。所以它写作「至少 30 条有明确记载」——30 是条目数下限;王铭钰一人对应汝原和 Morpho 两条,换算成「30 名高管离职」就是错的。时间归组的规则:成立年份是区间或双年份时,全部候选年份落进同一段才归组;松灵/库犸跨段,不强选一年。

履历核实不靠原表自证,补查来源例如:丰疆创始人用经济观察报的招股报道核对;Colin Guinn 查到美国国会听证记录;Jan Gasparic 的职务用大疆官方公告核对;R-Zero 用 Forbes 人物报道;Fairmart 用官网团队页;本末用 36 氪数据库。

四、拒绝算的数:融资、估值和三种率

融资金额和估值全程没有加总。审计记录列了七类问题:Morpho 条目混着汝原的融资而汝原另列一行,直接相加会重复;宇树的 IPO 募资、Dnsys 的众筹、它石的累计融资不是同类交易;卓驭含尚未完成的 Pre-IPO 计划;妙动、驰龙存在冲突口径,不能取大数当事实;若创的估值字段里填的是累计融资额;大量「数千万」「近亿元」没有可用的确定值;投前投后、币种、时点口径不一。

同样拒绝算的还有三种率:离职率、创业成功率、「创业潮」同比增速。90 条是公开资料名单,原调研有意重点搜集近年项目,加上融资披露偏差和媒体报道偏差,这些比率在方法论上站不住。写进文章的只有分布和案例:拓竹 2025 年营收超百亿元(据界面向拓竹确认的报道)、正浩 2017 年创办,都是单点事实,不进任何加总。

五、两道自检:对照样本与敏感分项

第一道,换样本看结论稳不稳。在 63 条内只保留原表标「确认」的 52 条重算:无人机占比 12.7% 对 13.5%,负责人经历 47.6% 对 50.0%,2024 年以来创办 46.6% 对 46.0%;种子至 Pre-A 这一项要把分母写明白,它对全部 63 条核心样本算是 36 条、57.1%,对 52 条确认子样本算是 29 条、55.8%,与上文 85.2% 那组(分母是 2024 年以来创办的 27 条)是两个口径,各自成立。四个方向都没变,主线结论对样本口径不敏感。

第二道,找对单源敏感的分项。软件/AI 从 8 条掉到 2 条——这个分项靠较弱证据支撑,所以正文不写「软件创业爆发」。加总数字好看,分项敏感性难看,两件事要一起看。

公开发布版另外经过事实归属与措辞合规审读,不影响本文统计口径。

六、这张地图看不见谁

能被媒体报道和社媒看到的创始人,已经过了三轮筛选:有人愿意写、有融资可披露、活到了被看见。安静做产品、没拿融资、失败离场的,整张地图都看不见。90 条里相当比例的项目只有一条公开报道。正文反复写明边界:这是公开资料的描述统计,不是行业普查;成立年份不等于离职年份;融资阶段不等于产品成熟度;不能用这些数计算任何公司的离职率或创业成功率。

附:复核材料

逐项审计 CSV(90 条,每条含纳入/单列理由、负责人编码、时间分组、来源链接)、统计结果 JSON(含源文件的 SHA-256)、只解析字面量的可复跑脚本。三个文件不改动原始资料,原始图谱和调研存档保持原样,口径可复跑、可挑错。

下次看到任何一张「XX 系创业公司 N 家」的地图,先问三个问题:单位是公司、品牌还是项目;N 里混了多少分拆、顾问和实习;它有没有公布自己拒绝计算的数字。