蓝皮书第 14 号特别报告
1952 年 3 月,空军决定评定它手上的每一份 UFO 报告。三年后它拿到了答案:一份针对约 4,000 份报告的统计研究,压成穿孔卡片,由四名分析员分类,入图 3,201 起。它至今仍是同类里最大的一份,自 1955 年 10 月起就是公开的,而几乎所有引用它的人只引用一个百分比。那个百分比是真的。它同时也只是十个之一,因为报告把自己的档案数了三种不同的方式,而对那些根本无法评定的案子,有四种同样站得住的处理办法。百分比底下还有更奇怪的东西。分析员注意到已知与未知的走势看起来一样,于是做了诚实的事:他们检验它。六项特征中的五项回答说这两组不是同一个总体,水平优于百分之一。报告把这称为不确定,转去在最好的十二个案子里找一个飞碟的模型,发现没有任何两个吻合,并据此得出任何一起未知是飞碟的概率极小。然后空军发布了它,附带一份声称问题已经解决的说明,而一个远低于档案里任何数字的数进入了流通。三份文件,一年,一个封面。这台台子把三份都印出来,一份也不合上。
打开互动演示 ▸ 你看到的是什么
分类台把 3,201 起案子做成一条分成六个箱子的横条,下方用一个方括号画出分母。换计数口径(全部报告、单位计数、目标计数)与规则(照发表、把信息不足移出分母、把信息不足并进分子、或套用报告自己的复审),标题数字就在你面前走动。底部一把尺同时载着全部答案,那个著名的 21.5% 与 1955 年的公开说法用不同颜色标出,因为它们是不同类的数字。
卡方检验台把报告的表 II 到表 XIII 做成一台你能跑的台子。已知向上以琥珀色升起,未知向下以青色落下,虚线是缺口,底部那条带显示每个分箱在 χ² 上要付多少。四个开关:哪一项特征、要不要像报告那样从已知里删去天文现象、统计量取报告的还是教科书的列联表形式,以及「未填写」这个箱子要不要参与检验。仪表把精确 p 值印在 1955 年拥有的那两条临界线旁边。
质量表把图 8 画成马赛克:列宽是组大小,列高是评定构成,白线是未知占比。它显示整份报告里最强的东西,优等目击挫败识别的可能性是差等的两倍;并且立刻显示被略去的那半,存疑组低于差等组。灰色虚线解释了为什么。侧栏跑的是报告从未对自己那一列可靠性做过的 4 × 2 列联表检验。
档案视图用十二张卡跑完 1947 到 1956:阿诺德、1952 年 3 月的决定、把堆头翻了三倍的那场热潮、穿孔卡片机器、分类、镜像图假设、检验、枢轴、复审专家组、失败的模型、结论,以及 1955 年 10 月的发布与它引出的回击。下方等大挂着两张判词,而两张都是报告自己的。
它为什么在这里
站里已经有一台统计仪器。INST-37 星门计划问的是:一条 7 个百分点的超额,在随机应得 25% 的地方,值多少钱。这台问的是一个更难看、也更常见的问题:当没有人对分母达成一致时,一个百分比值多少钱。第 14 号特别报告是 UAP 文献里被引用最多的政府文件,而它被引用的方式几乎总是同一句话:「空军自己的研究发现 21.5% 无法解释。」那句话是对的。它同时也是同一份档案在几条同样站得住的规则下给出的十个答案之一,而这十个答案铺开了将近十四个百分点。
但这台台子不是来拆台的。真正让第 14 号特别报告值得造一台仪器的,是它内部那道张力:它做了一个诚实的检验,得到了一个清晰的结果,然后写下了一个方向相反的结论。分析员注意到已知与未知的分布看起来相似,于是没有假定,而是检验。六项特征里的五项在优于 1% 的水平上否定了「它们是同一批东西」。报告随即把这个结果称为不确定,转去尝试从最好的十二个案子里拼出一个「飞碟」的模型,失败了,并据此得出未知是「飞碟」的概率极小。这两步都不荒谬。但它们不是同一个论证,而后来七十年里两边阵营各自只引用其中一半。这台台子两半都印出来,一半也不替你合上。
工作原理
这台仪器上的每一个计数都印在 1955 年那份报告里。其余一切都是对这些计数的算术,而随站发布的一个脚本会先从它们重新推出报告自己已发表的卡方值,通不过就不许构建。
χ²_报告 = Σ (K·r − n)² / (K·r),r = ΣN / ΣK · χ²_列联 = Σ (O − E)² / E · p = Q(df/2, χ²/2)
分母机就是除法,而这正是重点。三种计数口径乘四条规则,从同一份档案里做出十二个分数。报告自己就在图 2 里把三种口径并排发表,所以这里没有夹带私货:研究明说一起案子、一群观察者与一个目标是三种不同的单位,而它把「答案取决于你选哪一种」留给读者自己去注意。
卡方是报告自己的,原样复现。按总数之比缩放已知,使两个分布规模相同;逐箱取差、平方、除以折算后的已知,再求和。把已印计数喂回去,已印总数就出来,误差在分析员手算的四舍五入之内。这一步复现,是这台台子对那些表所做的其余一切的许可证。
p 值是 1955 年真正没法拥有的那一样东西。报告在教科书里查两个临界值,再报告自己落在哪一侧。这台台子直接求尾概率,于是「优于 1%」在持续时间那张表上变成大约三千万分之一,而亮度停在 p = 0.33。两条临界线仍留在仪表上,因为用 2026 年的算术读 1955 年的文件,只有让你看见差别才算诚实。
「未填写」开关给报告跳过的一个问题定价。每项特征都有一个箱子留给没人记录该属性的案子,而在亮度上它是全档案的 66%。把它从速度表里拿掉,χ² 从 38.3 落到 23.4:仍然显著,但三分之一的信号原来住在数据的缺席里。报告从未做过这个检查,而它只是一行算术。
而可靠性检验是报告根本没做过的那一个。图 8 就是一张列联表,却从未被当作列联表处理。跑一下:自由度 3,χ² = 63.0,p 约 10⁻¹³,这个关联比报告真正检验过的六项中的任何一项都强好几个数量级。这个结果不识别任何东西。它确实确立了一件事:分类并不独立于证据有多好。
这台台子拒绝做的事,是把一个差异换算成一次识别。五张表说两个分布不同,那是关于形状的陈述,不是关于来源的;而报告在从别处得出结论之前,自己也几乎是这么说的。仪器的纪律仍是本站惯常的那一套:印出测量,印出结论,标明哪个是哪个,再把能改变答案的那个旋钮交到读者手里。
决定结果的旋钮
两个管标题数字的算术,四个管检验,一个管报告忘了的那张表。没有一个能结案,而这正是发现本身。
- 计数口径。全部报告(3,201)、单位计数(2,554)、目标计数(2,199)。同一份档案,分别按报告、按观察方、按被描述的目标来数。报告三种都发表了,而文献把它们混着引用,大部分关于这份文件的混乱就从这里开始。
- 分母规则。处理「信息不足」那批案子的四种办法:留着、从分母里拿掉、挪进分子,或套用报告自己对其中 57 起未知的复审。每一种都有人印过。单在目标计数口径上,散布就是十三个半百分点。
- 特征。颜色、数量、形状、持续时间、速度、亮度。六张表,六种形状的分歧,以及关于「未知做了什么而已知没做」的六个相当不同的故事。持续时间最强;亮度是那个报告用来软化其余五项的零结果。
- 已知一侧:受检原样,还是删去天文现象。报告自己的修订,而背后的推理值得点开:已知一侧每一处大的超出都追得回可识别的天文物体,而颜色表上 130 起绿色已知里有 98 起是天文现象,报告把它们归给美国西南部的绿色火球。
- 统计量。报告的公式把已知当作固定参照分布;教科书的列联表卡方把它们当作第二个样本。在两者之间切换,答案几乎不动,而这就是对 1955 年算术的公道判词:粗糙,但没错。
- 「未填写」开关与质量度量。前者问每个结果有多少是由缺失数据扛着的。后者问那个著名的质量主张,在从每一组里剔除「信息不足」之后还剩多少。两者都部分幸存,而没幸存的部分就摆在屏幕上。
主张的现状
关于这份文件的六条主张,连同是谁提出的、以及对照已印表格它落在哪里。两条是实测。四条有争议,而多数是因为它们把报告确实说过的话只引了一半。
| 这项研究发现 21.5% 的案子无法解释 提出者 巴特尔纪念研究所,1955 | 实测 | 实测,而且在三种口径之一上是对的。3,201 起全部报告里的 689 起就是 21.5%。在目标计数口径下未知是 434 = 19.7%,而同一张图里的 474 = 21.5% 属于「飞机」。两个百分比都印在图 2 上。几乎每一次引用这份报告的人都挑了其中一个,而两个都没有点名。 |
| 报告越好,越可能没被解释 提出者 对图 8 的标准读法 | 有争议 | 一半是实测,一半是误引。优等报告 33.3% 归入未知,差等 16.6%:这是真的、醒目的,也被正确引用。但存疑报告是 13.0%,低于差等,所以那道单调台阶并不是这张图显示的东西。机制在仪器上看得见:随着质量下降,「信息不足」从 4.2% 爬到 21.4%,把案子从每一个被评定的类别里抽走。 |
| 卡方证明了未知是别的东西 提出者 UFO 文献里的强版本 | 有争议 | 说过头了,而且这个过头很要紧。六项特征中的五项确实在优于 1% 的水平上否定了同一总体假设,这在报告自己的数据上是个真结果。它许可你说的是:这两堆的形状不一样。它不许可任何关于未知是什么的陈述,而在有人拿它建东西之前,报告自己对每张表为何如此的讨论值得先读。 |
| 卡方结果是不确定的 提出者 第 14 号特别报告,第 69 页 | 有争议 | 报告对自己检验下的判词,也是整份文件转动的枢轴。它的推理是未知仍可能是比例不同的已知,就其本身而言是公道的。随后它没有继续追下去,而是彻底放弃统计路线,理由是数据的不准确会给出扭曲而无意义的结果。 |
| 空军在公开场合曲解了这份报告 提出者 利昂·戴维森,1956 | 有争议 | 有争议,而这台台子不对动机站队。可核验的是:1955 年 10 月的发布把这项研究呈现为已经解决了问题,而到达公众手里的未知数字远低于对这份档案的任何一种站得住的读法,因为它描述的是更晚的一批案子。戴维森自费重印了整份报告来做这个论证,这也是为什么许多人之所以读过它,得归功于一位私人公民。 |
| 表 X 算错了,而且它翻转了一个判读 提出者 在本台计算 | 实测 | 实测,十秒即可核对。表 X 的「其他」一行印着 1.76;它自己的两个数,折算后已知 51 与未知 54,给出 (51−54)²/51 = 0.18。改正后这张表总计 9.88 而非 11.46,于是落到同一页印着的 5% 临界值之下。十二张手算表,一处笔误,而它恰好落在那张会翻转答案的表上。 |
试试这个
- 从分类台开始,全部报告口径,照发表。21.5% 就在那里。现在点那条标着它的虚线,读一读图 2 里还有什么载着同一个百分比。
- 把口径切到目标计数。标题数字掉到 19.7%,而 474 起的「飞机」现在成了那个 21.5% 的箱子。什么都没有重算。变的是计数单位。
- 现在把规则换成剔除信息不足。22.2%。再换成并进分子:30.7%。两者都不是作弊。两者都被严肃的人印过,而报告从未说它偏好哪一个。
- 套用复审。17.1%,用的是报告自己那个专家组的结果。然后请注意:这个数字在报告里哪儿也找不到,因为专家组报告之后,图 3 从未重画。
- 点年份带里的 1952 那一块。2,199 起目标计数里的 1,501 起。不论这项研究测的是什么,它主要测的是一个夏天。
- 去质量表。优等 33.3%,差等 16.6%。这是整份文件里最强的单一事实,而且被引用得没错。现在把白线一路看到底,找到存疑组。
- 打开信息不足线,看它朝反方向爬。优等组 4.2%,差等组 21.4%。然后把度量切到「占已评定」,看看这个异常还剩多少。
- 读侧栏。可靠性表上 χ² = 63,一个报告从未检验过的关联,比它检验过的任何一个都强得多。
- 去卡方,持续时间,受检原样。49.5 对上 1% 临界值 18.5,现算 p 接近三千万分之一。这是报告在否定它自己最合理的那个假设。
- 切到速度,打开「剔除未填写」。χ² 从 38.3 落到 23.4。那个结果的三分之一,住在没人写下速度的那些案子里。
- 切到形状、修订后的已知,再读仪表。报告印的是 11.46,而它自己那一行给出 9.88。十二张表里一个点错的小数点,恰好落在改正后会跨过 5% 线的那一张上。
- 在档案收尾,把两张判词都读完。若你离开时确信这份报告是一场掩盖,你超出了证据。若你确信它已经解决了问题,你朝另一个方向超出了,而理由是它自己的表 V。
准确性
在报告印了什么、这里由它所印之物算出什么、以及什么是读法之间的诚实界线:
| 特征 | 等级 | 含义 |
|---|---|---|
| 图 2、图 3、图 4,完整 | T1 实测 | 报告三种计数口径下的分类结果:全部报告 3,201 起、单位计数 2,554 起、目标计数 2,199 起,各自分进同样六个评定箱。每一列都精确加总为它自己印出的总数,而这正是校验脚本第一件要查的事。逐年分布取自图 4,包括单出自 1952 年的 1,501 起目标计数。 |
| 图 8,可靠性表 | T1 实测 | 全部二十四格:四个目击可靠性组(优 213、良 757、存疑 794、差 435)乘六个评定。每组六格加总为该组总数,四个未知格加总为卡方各表所用的 434。没有任何四舍五入、合并或剔除,包括那个打断了人人引用之趋势的存疑组。 |
| 全部十二张卡方表 | T1 实测 | 表 II-VII 与表 VIII-XIII:六项特征,已知 1,765 与修订后已知 1,286,对上 434 起未知,连同报告印出的卡方值、自由度与两个临界值。每张表在三列上都对得起来,而两列已知之差恰好加总为报告声称删去的 479 起天文现象目标计数。 |
| 复审账本 | T1 实测 | 表 I 与随后那个专家组:日光太阳仰角组里的 186 起未知、重开的 164 份卷宗、18 起可能是飞机、20 起可能是气球、19 起可能是其他已知、100 起仍为未知、7 起「好未知」,加上夜间扫查再得的 5 起,合共 12 起。186 这个数字不是在此断言的:把表 I 里正确的五列相加,它自己就掉出来。 |
| 精确 p 值 | T2 建模 | 报告只能在印好的表里查 5% 与 1%。这台台子用正则化上不完全伽马函数求卡方尾概率,于是持续时间那项读作大约三千万分之一,而不只是「优于 1%」。两条临界线仍然画着,因为那才是 1955 年真正摆在面前的东西。 |
| 检验的列联表形式 | T2 建模 | 报告的统计量把已知缩放到未知的总数,再求 (K−n)²/K 之和,这等于把已知当作固定的参照分布而非第二个样本。教科书里的比较是 2 × m 列联表卡方,期望值取自边际。两者都在开关上。它们几乎不打架,而这件事值得在有人说 1955 年的算术不可靠之前先知道。 |
| 对图 8 的检验 | T2 建模 | 对报告可靠性与「是否未知」做 4 × 2 列联表卡方:自由度 3,χ² = 63.0,p 约 10⁻¹³。它以很大优势成为整份文件里最强的关联,而报告从未做过。由此推不出任何阴谋;它只是最难被解释掉的那一个。 |
| 十条规则的散布与 17.1% | T2 建模 | 三种计数口径对四条分母规则,全部是对已发表计数的算术,从 17.1% 到 30.8%。十二种组合里成立的是十种,因为复审那条规则只够得到目标计数口径。17.1% 是报告自己的复审在目标计数口径下、把它重新分类的 57 起套用之后所隐含的数。报告把那个专家组的结果写进了正文,却让图 3 保持原样。 |
| 「不到 3%」这个标记 | T3 读法 | 画在同一把尺上是为了对照,并单独标注,因为它是另一类数字:它属于 1955 年 10 月随报告发布的材料,描述的是空军当时那套案件处理程序,不是这份 3,201 起案子的档案。它与尺上每一根刻度之间的距离,正是 1956 年那本小册子存在的理由。 |
| 那些未知究竟是什么 | T3 读法 | 敞着,而仪器拒绝替你关上。两个分布之间一个测出来的差异,不是对其中任何一个的识别。报告明白这一点,写下比例不同的误认是更可能的情形,然后给出了让它被记住的那个结论。两者都在档案视图上,等大。 |
一句话: 这台台子上的每一个计数都印在 1955 年那份报告里并完整携带,图 2、图 3、图 4、图 8、表 I 与全部十二张卡方表在每一列上都对得起来;精确 p 值、检验的列联表形式、图 8 上的卡方、十条规则的散布与 17.1%,都是对这些计数的「建模」算术,并在构建通过之前由 scripts/sr14-tune.mjs 检验;「不到 3%」这个标记是「转述」,它属于 1955 年 10 月的发布而不属于这份档案;而那些未知究竟是什么,是一个本台拒绝作出的读法,它把报告的结论与报告自己的算术精确等大地挂在对面。挑一个分母,跑一遍那个检验,然后找出被另一半否掉的那句话。
资料来源
- Primary document: Battelle Memorial Institute, "Analysis of Reports of Unidentified Aerial Objects", Project Blue Book Special Report No. 14, Study No. 102-EL-55/2-79, Project No. 10073, Air Technical Intelligence Center, Wright-Patterson AFB, 5 May 1955. Every count on this instrument is read off a printed figure or table of that document: Figures 1-4 (pp. 17-20), Figure 8 (p. 24), Table I (p. 60), Tables II-VII (pp. 62-67), Tables VIII-XIII (pp. 70-75), the re-evaluation and the "flying saucer" model attempt (pp. 76-93), and the Conclusions (p. 94).
- The report's definition of its terms, Introduction pp. 1-2: J. Allen Hynek's definition of a "flying saucer" as "any aerial phenomenon or sighting that remains unexplained to the viewer at least long enough for him to write a report about it", which the report quotes and then replaces with its own narrower one, "a novel, airborne phenomenon, a manifestation that is not a part of or readily explainable by the fund of scientific knowledge known to be possessed by the Free World".
- The report on the quality of its own data, pp. 3-4: "any conclusions contained in this report are based NOT on facts, but on what many observers thought and estimated the true facts to be"; the note that a few reports originated from people confined to mental institutions; and the Summary's statement that the subjectivity of the data "presented a major limitation to the drawing of significant conclusions, but did not invalidate the application of scientific methods of study".
- The chi square method as the report states it, p. 61: "a statistical test of the likelihood that two distributions come from the same population", with the four-step procedure, the adjustment of knowns to the unknowns' total, and the printed 5% and 1% critical values. The discussion of what drove each result, pp. 68-69, including the finding that 98 of the 130 green knowns were astronomical and attributable to the green fireballs of the south-western United States.
- The re-evaluation and the model attempt, pp. 76-93: 164 folders of 186, the five outcomes, the twelve good unknowns sorted into propeller, aircraft, cigar and disc shapes, the four conditions a model would have had to satisfy, and the conclusion that "out of about 4,000 people who said they saw a 'flying saucer', sufficiently detailed descriptions were given in only 12 cases. Having culled the cream of the crop, it is still impossible to develop a picture of what a 'flying saucer' is."
- The Conclusions, p. 94, quoted on the instrument's file view: that it can never be absolutely proven that "flying saucers" do not exist; that the failures to identify are attributed to reported manoeuvres and to the unavailability of supplemental data such as aircraft flight plans and balloon-launching records; that "there was a complete lack of any valid evidence consisting of physical matter"; and the two probability statements, "extremely small" and "highly improbable".
- The document as released: the U.S. Air Force made the study public in October 1955. The "under 3%" figure carried on the instrument's ruler belongs to that release and to the Air Force's then-current investigation programme, not to the 1947-1952 file the study analyses. This site's own Release 03 briefing on the document covers the released version and its framing.
- Leon Davidson, "Flying Saucers: An Analysis of the Air Force Project Blue Book Special Report No. 14", first published 1956 and reprinted in later editions, which reproduced the report at the author's own expense in order to argue that the public account and the document disagreed. Cited here as the origin of the dispute, not as an endorsement of its conclusions.
- Scanned copies of the full report, including all 240 charts, tables and figures and the 255-page Appendix A of frequency tabulations, are on the Internet Archive and in the Black Vault document archive. Every number used here can be checked against those scans, and scripts/sr14-tune.mjs re-derives the report's own published chi squares from the counts it prints.