02-评分手册-v1.md
Markdown 原文逐字发布,未经渲染加工。版本 8508aeb。
# EXO-TRACE 证据等级与置信度评分手册 v1.1 > 本手册是唯一执行的评分标尺。不得与任何其他评分体系混用。 > 混用不同标尺会使案例之间的分数不可比,整个证据矩阵随之作废。 --- ## 0. 总则 ### 0.0 发布门禁与评分对象(2026-07-25 独立审计后新增,构建期强制) **发布门禁(审计 P0-1,v1.1 修订)**:`publication_status` 流转为 `ai_draft → source_checked → fact_checked → method_reviewed → published → corrected/retracted`。 `published` 必须同时具备:具名人工审核人、审核日期、审核角色/专业、方法版本、 **核心命题绑定 + ≥1 已核实来源 + ≥1 已核验原子主张**; 报告证据缺口的主张以未核验状态如实展示,不阻断发布。 **AI 起草且未经人工复核的记录,不得超过草稿态——由 validate.mjs 强制,违者构建失败。 AI 不得复核 AI 自己生成的内容后标注为「人工复核」。** > **v1.1 修订记录(2026-07-26)**:published 门禁由 v1.0 的「全部原子主张已核验或标明争议」 > 改为上行的「核心命题绑定 + ≥1 已核实来源 + ≥1 已核验原子主张」。 > 理由:旧门禁把「报告证据缺口」类主张也当成待核验项——墨西哥案 > (`mexico-congress-alien-bodies-2023`)的「标本同一性未证明」主张**本身就是结论**, > 要求它「被核验或标明争议」在逻辑上不成立;对证据缺口的正确处理是以未核验状态如实展示, > 而不是阻断发布。 **评分对象绑定(审计 P0-5)**:每条记录必须有 `focal_claim_zh`(一句话可证伪核心命题)与 `score_targets_zh`(五项分数各自评什么)。**E 分必须绑定核心命题**,不得评「文件/文物是否存在」—— 那是 S 的职责。此前 AARO 报告 E=98(评报告存在)与 Alien Autopsy E=5(评解剖真实性) 在同一轴上不可比,即为本条要修的缺陷。 **前台展示(审计 P0-5)**:在完成双人盲评与锚点校准前,前台以等级词为主 (可忽略/很弱/有限/中等/强/极强),0–100 草稿分退居次要标注——单点整数在未校准时是虚假精度。 **status 字段过渡说明(审计 P0-6)**:当前 `status` 承载的是「解释状态」语义; 来源可追溯性、事件发生、数据充分度等维度将拆分为独立字段逐步迁移, `publication_status` 是第一个拆出的轴。**在迁移完成前,不同维度的值混在 status 中的记录仍存在, 统计与筛选据此有已知的语义不稳定——这是公开的技术债,不是已解决项。** ### 0.1 五项独立指标 | 代号 | 名称 | 回答的问题 | 对应四层区分 | |---|---|---|---| | **S** | 来源可信度 | 原件、身份、档案号、保管链可靠吗? | L1 | | **E** | 事件可信度 | 所描述的观测或事件**是否确实发生**? | L2 | | **D** | 数据充分度 | 有无原始数据、完整上下文、独立来源? | 横切 | | **A** | 异常程度 | 常规解释经过多大程度的检验与排除? | L3 | | **X** | 外星假说支持度 | 证据是否**特异性**支持外星生命或非人技术? | L4 | ### 0.2 三条不可违背的规则 1. **不做加权平均。** 五项分数并列显示,永不合成为单一"外星概率"。 2. **不表述为概率。** 只用分数、等级、区间。禁止"外星可能性 72%"这类表述。 3. **锚点比对优先于直觉。** 打分时必须先找到最接近的锚点案例作横向比较,再落分。 ### 0.3 分数与等级映射 | 分数 | 等级 | 含义 | |---|---|---| | 85–100 | 极强 | | | 70–84 | 强 | | | 55–69 | 中 | | | 40–54 | 弱 | | | 20–39 | 很弱 | | | 0–19 | 可忽略 | | --- ## 1. S — 来源可信度 **衡量:这条记录本身有多可靠。与外星人无关。** ### 1.1 基础分(按最高等级来源定) | 来源等级 | 基础分 | 判据 | |---|---|---| | **A** 原件馆藏 | 88 | 原始数据、原文件、馆藏原件,保管链完整,有档案号/馆藏号 | | **B** 可复核研究 | 82 | 方法与数据公开、可被独立复核的专业研究(含同行评议论文) | | **C** 机构记录 | 74 | 政府、军方、博物馆、法院、听证等机构的正式记录 | | **D** 一手同期证词 | 58 | 身份可核实的第一手、同期作出的证词 | | **E** 有引用链的二手 | 46 | 新闻、专著、纪录片,具备明确引用链 | | **F** 匿名无出处 | 22 | 匿名帖子、剪辑视频、无出处截图、自媒体转述 | | **R** 已反驳/骗局/虚构 | 按材料本身定 | 保留作对照。**注意:造假过程本身若有可靠记录,S 可以很高** | ### 1.2 修正项 | 修正 | 幅度 | |---|---| | 原件可直接访问(官方 URL + 存档快照 + 档案号) | **+5** | | ≥2 个 `independent_group` 不同的来源交叉印证 | **+8** | | ≥4 个 `independent_group` 不同的来源交叉印证 | **+12** | | 存在直接经济利益冲突(售书/付费演讲/收费纪录片/众筹) | **−10** | | 事件发生与首次记录间隔 > 10 年 | **−8** | | 关键当事人拒绝或无法接受独立核验 | **−10** | | 原始材料已灭失,仅存转述 | **−12** | | 来源身份存疑或曾被证明作出虚假陈述 | **−15** | 最终 S = clamp(基础分 + 修正项之和, 0, 100) ### 1.3 ★ S 跟随本站的描述,不跟随主张者的描述 > **判据:S 评的是「本站所引用的那份材料,作为<u>本站所描述的那种东西</u>,有多可靠」。** 这条是 P1 一致性检验中出现的**第一个重大分歧**所催生的判据修订(分歧幅度 66 分,远超 25 分阈值)。 **触发案例:《Vaimānika Śāstra》** | 评分者 | S | 理由 | |---|---|---| | A | 78 | 这份材料的来龙去脉记录得极清楚:口述于 1918–23、记录者 G. V. Sharma、1950s 出版、1918 年前无写本。来源链完整 | | B | 12 | 作为一份**古印度典籍**,它完全不可靠——年代前提就是假的 | 两种理解都自洽,说明判据有歧义。**裁定采用 A**,理由如下: - 本站对该文本的描述是「一份 1918–23 年的通灵口述文本」,而**这个描述是有充分证据支持的** - 若本站把它描述成「古印度航空典籍」,S 应接近 0——但本站不这样描述,因为那个描述是错的 - 把「主张者说错了」算进 S,会导致 S 与 E 重复计分:**主张的真假是 E 的职责,不是 S 的** **推论**:一份被彻底查清的伪作,S 可以很高。`vaimanika-shastra` 当时据此评 S=78 / E=2——不是矛盾, 而是四层区分最纯粹的呈现——**我们非常清楚它是什么,正是这份清楚使它被证伪。** > **注(2026-07-26)**:审计重审后该案当前分数为 S=12(改按「主张所需的来源身份」评,即当时评分者 B 的取向), > 与本节裁定取向相反。本节保留作裁定过程的历史记录;两种取向的统一列入「已知问题(下一轮)」节,待双人校准轮裁决。 反过来,若某份材料**连"它到底是什么"都无法确定**(作者不明、年代不明、保管链断裂), 那才是 S 低的情形——例如 `saqqara-bird-glider-claim`(S=58,出土记录不完整)。 ### 1.4 常见错误 - ✗ 把"这份文件很重要"当成"这份文件很可靠" - ✗ 把转载数量当成交叉验证(见第 9 条 伪交叉验证) - ✗ 因为主张听起来离谱就压低 S —— **S 只评来源,不评内容** - ✗ 因为主张者对材料的定性是错的就压低 S —— 见 §1.3,那是 E 的职责 --- ## 2. E — 事件可信度 **衡量:文件里描述的那件事,到底发生没发生。仍然与外星人无关。** | 分段 | 判据 | |---|---| | 85–100 | 有独立仪器记录(雷达/遥测/多台设备)证明该时刻确有物理事件发生 | | 70–84 | 多名互相独立的目击者 + 至少一项同期物理记录(照片、日志、录音) | | 55–69 | 多名目击者同期一致陈述,无物理记录 | | 40–54 | 单一目击者同期陈述,或多人事后回忆 | | 20–39 | 事后多年回忆,或经由他人转述 | | 5–19 | 事件描述与已知物理/历史事实冲突,但无法完全排除 | | 0–4 | 已确证该事件未发生(含造假承认、时间地点被证伪) | ### 2.1 神话与古籍的 E 分特别说明 古籍类记录的 **S 可以很高**(文本确凿存在、版本与馆藏可查),但 **E 通常极低**——「《日本書紀》确实记载了天孙降临」与「天孙降临确实发生过」是两回事。 对于神话记录,E 分评的是**文本所描述的事件本身**,不是文本的存在。绝大多数神话条目 E ≤ 15。 --- ## 3. D — 数据充分度 **衡量:可供他人独立检验的材料有多完整。** | 分段 | 判据 | |---|---| | 85–100 | 原始数据可获取(未压缩影像/雷达原始记录/完整档案卷宗)+ 完整上下文 + ≥3 独立来源 | | 70–84 | 原始数据部分可获取 + ≥2 独立来源 | | 55–69 | 有完整的二手记录与上下文,原始数据不可得 | | 40–54 | 记录不完整,关键上下文缺失(时间、地点、设备参数之一缺失) | | 20–39 | 只有片段材料,或多个关键字段缺失 | | 0–19 | 只有一句话主张,无任何可检验材料 | ### 3.1 硬性上限 - 仅有社交平台压缩视频 → **D ≤ 30**,且强制标记「原文件缺失」 - 原始材料已灭失、仅存转述 → **D ≤ 30** - 无法确定拍摄/记录时间或地点 → **D ≤ 45** --- ### 3.2 ★「已证伪」针对材料,不针对诠释 > **判据:`已证伪` 只在<u>材料本身</u>不成立时使用——伪造、年代前提被推翻、当事人承认制作。 > 若一手材料真实可追溯,只是建立在它之上的外星诠释站不住,状态应为 `来源可追溯`, > 由 high 强度的替代解释去压 X。** 这条来自苏美尔阿努纳奇案例的分类错误。该条初评为 `已证伪`,但: | | 苏美尔阿努纳奇 | 《Vaimānika Śāstra》 | |---|---|---| | 一手材料 | 《Atrahasis》《Enūma Eliš》等泥板,**真实存在**,S=85 | 文本被谎称为古籍,年代前提是假的 | | 被否定的是 | Sitchin 的**译读** | **材料的身份** | | 正确状态 | `来源可追溯` | `已证伪` | 把真实的古代文献标成「已证伪」,等于宣称那些泥板是伪造的——**这是一个错误陈述, 而且是本站最不能犯的那一类。** 外星诠释被否定这件事,由四条 high 强度的译读失真/母题普遍性反证记录, X 自然被门槛压到 30 以下,不需要动状态。 同一逻辑:`shiyiji-guanyue-cha`(《拾遗记》真古籍,外星读法不成立)也是 `来源可追溯`。 --- ## 4. A — 异常程度 **衡量:常规解释被检验和排除得有多彻底。注意这评的是"排除工作做得多好",不是"看起来多离奇"。** | 分段 | 判据 | |---|---| | 85–100 | 逐项排除了:已知飞行器、气球/灯笼/烟花、天体(金星、流星、极光、幻日)、卫星与火箭再入、鸟类与昆虫、镜头伪影(眩光、鬼影、散焦)、大气光学现象、雷达异常传播、软件伪影;且排除过程有公开记录 | | 70–84 | 主要常规解释已被专业机构检验并排除,仍有 1–2 项未完全排除 | | 55–69 | 部分常规解释被检验,结论为"未识别",但排除工作不完整 | | 40–54 | 常规解释可能性与异常性相当,缺乏系统排除 | | 20–39 | 存在一个可信度较高的常规解释,但未被完全确认 | | 5–19 | 常规解释充分覆盖 | | 0–4 | 已确证为常规现象或人为制造 | ### 4.1 关键规则 > **官方标记「未识别/Unidentified」只影响 A 分,不得因此提高 X 分。** 「未识别」是一个**行政分类**,含义是"调查资源用尽而未归类",不含起源判断。Project Blue Book 的 701 例未识别、GEIPAN 的 D 类,都属此列。 ### 4.2 常见错误 - ✗ 把"我想不出别的解释"当成 A 高分 —— **诉诸无知谬误** - ✗ 把目击者的惊异程度当成异常程度 - ✗ 忽略调查者是否具备排除相关现象的专业能力 --- ## 5. X — 外星假说支持度 **衡量:假定前四层都成立,这条证据是否<u>特异性</u>指向地外智慧或非人技术。** 「特异性」的含义:该证据**在地外假说下的出现概率,显著高于在所有已知常规假说下的出现概率**。仅仅"奇怪"不构成特异性。 | 分段 | 判据 | |---|---| | **90–100** | 可独立复现的实体证据:非自然同位素比例的材料、非地球生物样本、明确的人工制品。**全球目前无任何案例达到此段。** | | 70–89 | 多传感器同步记录 + 系统排除常规解释 + 表现超出已知工程能力(如无推进痕迹的极端加速),且有独立团队复核 | | 50–69 | 高质量多证人 + 多模态仪器记录,常规解释无法完全覆盖,但无物证、无独立复核 | | 30–49 | 有可靠记录,但常规解释的可能性与之相当或更高 | | 10–29 | 主要依赖诠释与联想(神话文本、艺术品解读、古代工艺推测) | | 0–9 | 已被常规解释充分覆盖,或已确证为骗局 | ### 5.1 X 分硬性门槛(构建期强制校验,违反则构建失败) | 条件 | 上限 | |---|---| | 找不到原始来源 | **X ≤ 20** | | 仅有单一目击者 | **X ≤ 40** | | 仅有社交平台压缩视频(无原文件) | **X ≤ 35** | | 存在强度为 high 的**替代机制**未被反驳 | **X ≤ 30** | | 声明了强度为 high 的**证据效力限制** | **D ≤ 50**(反向约束,见 §5.1.1) | | 官方分类为"未识别"但无其他证据 | **X ≤ 45** | | `status == 已证伪` | **X ≤ 5** | ### 5.1.1 两类反证:替代机制 vs 证据效力限制 反证不是一种东西,是两种。混在一起会造成**同一件事扣两次分**。 | | **替代机制** (`alternative-mechanism`) | **证据效力限制** (`evidential-limit`) | |---|---|---| | 内容 | 提出一个不诉诸地外假说的**具体成因** | 不提供成因,只指出**证据本身不足以支撑结论** | | 例子 | 「非引力加速度可由挥发物脱气产生」 | 「近五十年重观测均未复现,单次不可复核事件无法支撑强结论」 | | 该扣哪个分 | 压 **A**(常规解释未被排除)与 **X** | 压 **D**(数据充分度) | | 触发 X ≤ 30 门槛 | **是**(strength=high 且未被反驳时) | **否** | | 反向约束 | — | strength=high 时 **D 必须 ≤ 50**,否则自相矛盾 | > **这条规则来自 Wow! 信号的实际评分冲突。** > 该案的「不可重复」被标为 high 强度反证,触发了 X ≤ 30,但它已经计入 D=34 了。 > 反证方自己就写明:「这一点限制的是证据效力,而非提供替代机制。」 > > 反向约束同样重要:如果你声称证据不足以支撑结论,却给了一个高 D 分,那是自相矛盾——校验器会拦下来。 ### 5.2 X ≥ 70 的准入条件(必须全部满足) 1. 原始数据可获取 2. ≥2 个 `independent_group` 不同的来源 3. 有公开的替代解释排查记录 4. ≥2 种证据模态(多模态) 5. 有独立团队复核记录 **任一条不满足,X 不得超过 69。** ### 5.3 关于上限 **本手册 v1 暂不允许任何案例 X > 75。** 该上限不是对可能性的否定,而是对**当前公开证据总量**的如实反映。若未来出现满足 90+ 判据的案例,须经修订本手册并公开说明后方可突破。 --- ## 6. 锚点案例表(v1 暂定,P1 校准后定稿) > 打分不是凭感觉给数,是**跟锚点比**。新案例必须先找到最接近的锚点,再判断高于还是低于它。 > 下表全部为**库内真实案例**,可点开逐条核对评分理由。 ### 6.1 S 来源可信度锚点 > 2026-07-26 审计重审后更新;此前锚点值见 git 历史。 | 分数 | 锚点案例 | 为什么是这个分 | |---|---|---| | 96 | `seti-null-results-breakthrough-listen` | 同行评议、原始数据公开、多团队多方法复现 | | 91 | `palenque-pakal-sarcophagus-lid` | 实物在原址、一手发掘报告已实际核验;多季报告与图录未全核,故不给更高 | | 88 | `nimitz-2004-tictac` | 国防部正式发布 + 国会宣誓证词,机构原件级 | | 88 | `shiyiji-guanyue-cha` | 古籍确凿、卷次已逐字核验、多机构数字化可查 | | 86 | `wow-signal-1977` | 打印输出为馆藏一手材料,但原始时序数据已遗失 | | 66 | `billy-meier-photographs` | 材料存在但保管链混乱、当事人有直接经济利益冲突 | | 58 | `saqqara-bird-glider-claim` | 实物存在但出土记录不完整、后续检验结论互相冲突 | | 12 | `vaimanika-shastra` | 重审改判:作为主张所需的「古代典籍」,来源身份不成立(此前依 §1.3 取向评 78;两种取向的统一见「已知问题」节) | ### 6.2 E 事件可信度锚点 > 2026-07-26 审计重审后更新;此前锚点值见 git 历史。 | 分数 | 锚点案例 | | |---|---|---| | 99 | `oumuamua-1i-2017` | 天体的存在与轨道参数无任何争议 | | 96 | `crop-circles-bower-chorley` | 麦田圈确实存在——这从来不是争议点 | | 68 | `nimitz-2004-tictac` | E 改绑核心命题「表现超出已知飞行器能力」:遭遇本身有强支持,但性能异常环节系证词内的二手转述(重审自 86 下调) | | 38 | `venus-phosphine-2020` | **观测量本身是否存在**都有争议,与诠释之争不同 | | 5 | `alien-autopsy-1995-santilli` | 制作者本人已承认 | | 2 | `shiyiji-guanyue-cha` | 文本存在(S=88),事件几乎确定未如描述发生 | | 1 | `vaimanika-shastra` | 所声称的"古代技术传承"不存在 | > **6.1 与 6.2 并排看**:`shiyiji-guanyue-cha` 的 S=88 / E=2,`alien-autopsy-1995-santilli` 的 S=90 / E=5。 > 这个组合就是四层区分的全部意义——**我们非常清楚它是什么,正是这份清楚使它被证伪或压低。** ### 6.3 A 异常程度锚点 > 2026-07-26 审计重审后更新;此前锚点值见 git 历史。 | 分数 | 锚点案例 | | |---|---|---| | 62 | `oumuamua-1i-2017` | 当前全库最高。非引力加速度是真实异常,已有多种可信自然机制 | | 55 | `nimitz-2004-tictac` | 官方归类未识别,但从未公开任何排除分析;原始数据缺失使「常规解释无法覆盖」的判断本身失去检验基础(重审自 66 下调) | | 42 | `wow-signal-1977` | 重审自 74 下调:「排除工作受材料所限无法完成」压 D 不抬 A;RFI 与人造天体从未被证据性排除 | | 38 | `phoenix-lights-1997` | **两起事件必须分列**:第二起解释充分,第一起未闭合 | | 22 | `roswell-1947-project-mogul` | 残骸解释强,遗体分支的时间线仍未闭合 | | 10 | `crop-circles-bower-chorley` | 制作方法已公开演示并可任意复现 | | 2 | `starlink-satellite-trains` | 可逐案用公开星历精确回溯 | ### 6.4 D 数据充分度锚点 > 2026-07-26 审计重审后更新;此前锚点值见 git 历史。 | 分数 | 锚点案例 | | |---|---|---| | 96 | `starlink-satellite-trains` | 每一次过境都有公开星历可查 | | 85 | `roswell-1947-project-mogul` | 空军两份报告 + 1947 年当时新闻稿原件 + GAO 记录查找 | | 41 | `oumuamua-1i-2017` | 观测窗口极短,天体已远离,**无法补测** | | 35 | `nimitz-2004-tictac` | 原始雷达记录与完整 ATFLIR 数据未公开,仅有转码片段;雷达环节只剩单一证据链(重审自 58 下调) | | 30 | `fermi-paradox-drake-uncertainty` | 不存在数据——结论完全由先验假设驱动 | | 28 | `wow-signal-1977` | 一台望远镜、一次探测、一份打印输出;逐秒原始数据未保存(重审自 34 下调) | ### 6.5 X 外星假说支持度锚点 > 2026-07-26 审计重审后更新;此前锚点值见 git 历史。 | 分数 | 锚点 | | |---|---|---| | **90+** | **空缺 —— 迄今无案例达到** | **这个空缺本身是全站最重要的一条陈述** | | 42 | `nimitz-2004-tictac` | 当前全库最高。多名宣誓证人 + 官方未识别定性并存,但「多传感器互证」叙事不成立、无物证、原始数据不可得(重审自 65 下调) | | 22 | `oumuamua-1i-2017` | 存在 high 强度自然解释(脱气),诠释不构成特异性支持 | | 15 | `wow-signal-1977` | 「窄带 + 近氢线」仅为弱正面匹配,单次不可复现是决定性的(重审自 35 下调) | | 8 | `shiyiji-guanyue-cha` | 古籍中的"飞行器"描述,依赖诠释 | | 2 | `seti-null-results-breakthrough-listen` | **S=96 / D=90 的顶级案例,X=2** —— 来源质量与外星支持度完全正交 | | 1 | `alien-autopsy-1995-santilli` | 已证伪 | ### 6.6 首批 30 条的 X 分布形态(值得记录的观察) > 注(2026-07-26):下图与三点观察是**首批 30 条初评时的历史快照**,保留作方法记录,图中分数为重审前旧值。 > 重审后的当前全库分布(52 条:最高 42,48 条 X ≤ 15)见 README「当前阶段」与首页统计。 ``` 65 ┤ ■ nimitz │ 35 ┤ ■ wow-signal 22 ┤ ■ oumuamua 18 ┤ ■ blc1 │ 12 ┤ ■■■■ phoenix / 拾遗记 / tabby / 镜头伪影 9 ┤ ■■ 3I-ATLAS / roswell │ ≤6 ┤ ■■■■■■■■■■■■■■■■■■■■■ 其余 20 条 ``` 三点观察: 1. **只有一条超过 40。** 65 与 35 之间是一段空白——当前公开证据里没有"中间地带"的强案例。 2. **分布极度底部聚集**:30 条中有 20 条 X ≤ 6。 3. **S 与 X 几乎不相关。** S 最高的四条(96 分)里,X 分别是 18、3、2、1。这不是巧合,是本站的核心论点。 --- ## 6.5 神话与古籍类的三类反复出现的反证结构 (来自 P1 神话维度核查的实证归纳,应在评分时主动检查这三项) ### 6.5.1 文本自带解释 异常往往**在一手材料内部就已经消解**,是二手论述剥离语境后才产生的。评分时必须回到原文上下文。 | 案例 | 二手论述的读法 | 一手文本自带的解释 | |---|---|---| | Tuatha Dé Danann「乘黑云而至」 | 云中降临的飞行器 | 同一文本随后说明黑云是**焚船产生的烟雾** | | 《梦溪笔谈》扬州珠「张壳露珠」 | 金属壳体开合 | 「珠生于蚌」是当时对发光体的**既有解释模型**,观察者以现成文化范畴组织所见 | | Wandjina 岩画的大眼无口形象 | 头盔与面罩 | 在其自身信仰体系中即为**云与雨** | ### 6.5.2 年代缺口,而非年代久远 > **真正的问题不是「文本古老」,而是「文本与事件之间没有链」。** | 案例 | 缺口 | |---|---| | 《竹取物语》 | 成篇推定 9 世纪末–10 世纪初,**现存最古写本为 1592 年**,相隔约 700 年 | | 《拾遗记》 | 文本成于 4 世纪,所述事件托于上古,相隔逾 2000 年 | 凡以**字句细节**论证者,必须先说明所据版本与校勘依据,否则该细节的年代归属不成立。这一项直接压低 **D 数据充分度**,并作为 `type: dating` 的替代解释记录。 ### 6.5.3 二次文献污染链 > **在神话维度,绝大多数「证据」实际上是 20 世纪的二次文献,而不是古代材料。** 因此每个二次文献来源必须额外登记 `cited_source_actually_used`(该论者**实际依据的是什么**)。典型污染链: - Pauwels & Bergier 的法文改译 → Berlitz → Childress:所谓《摩诃婆罗多》「核战争」引文,梵语原文查无对应 - Sitchin 对苏美尔文本的译读:不被亚述学界接受 - Blumrich 对以西结书的引用:引文经过改动 - Griaule 的多贡记录:存在**回馈污染**(观察者带入 → 被观察者反馈) **判定规则**:当 `cited_source_actually_used` 与 `sources` 中的一手材料不是同一份东西时,该来源的 tier 按二次文献计,且不得单独构成一个 `independent_group`。 --- ## 7. 评分流程 ``` 1. 通读全部已收集来源,先不打分 2. 判定 status(待核验/存在争议/常规解释较充分/尚未解释/已证伪/…) 3. 逐项打分,每项都先找锚点再落分:S → E → D → A → X 4. 写评分理由(每项一句,X 分必须解释"为何不能更高") 5. 跑门槛校验(scripts/validate.mjs) 6. 门槛不通过 → 回到第 3 步,不得手工豁免 7. 记录审核人、日期、AI 参与程度、模型版本 8. 设定 next_review_due ``` --- ## 8. 评分者一致性校验(P1 准入门槛) P1 的 30–50 条标杆案例必须通过一致性检验,才允许进入 P2 铺量。 **方法**:同一批案例由两轮独立评分(可为不同评分者,或同一评分者在不掌握首轮结果的情况下重评)。 **达标标准**: | 指标 | 要求 | |---|---| | 单项分数差 ≤ 15 的比例 | ≥ 80% | | 单项分数差 > 25 的案例 | 0 条(必须逐条讨论并修订判据) | | status 分类不一致 | ≤ 10% | 未达标 → **修订本手册的判据描述**(而不是修改分数去凑一致),重新校验。 --- ## 9. 伪交叉验证的识别 > **一百篇文章转载同一段视频,只算一个独立来源。** 计算"独立来源数"时: 1. 先对每个来源填 `earliest_known_source` 与 `derived_from` 2. 沿引用链回溯到根节点 3. 同一根节点下的所有来源合并为**一个** `independent_group` 4. 无法判定是否独立时,**按不独立处理** 只有 `independent_group` 数量才计入 S 的交叉印证修正与 X ≥ 70 的准入条件。 --- ## 10. 常见评分错误速查 | 错误 | 正确做法 | |---|---| | 因为来源权威就提高 X | S 高只说明记录可靠,与外星无关 | | 因为"官方说未识别"就提高 X | 未识别只影响 A | | 因为主张离谱就压低 S | S 只评来源质量 | | 因为目击者是名人就提高 S | 知名度不加权,只作身份标签 | | 因为转载很多就提高 D | 见第 9 条 | | 因为想不出别的解释就提高 A | 诉诸无知谬误,A 评的是排除工作的完整度 | | 用五项的平均分排序 | 永不合成单一分数 | | 古籍确凿就给高 E | S 与 E 是两层,古籍类 E 通常 ≤ 15 | --- ## 11. 已知问题(下一轮) 1. **E 轴评分对象绑定不一致**:E 轴评分对象在部分已证伪案例中绑定「事件基底/器物真实性」而非核心命题 (如 `crop-circles-bower-chorley` E=96、`antikythera-mechanism-ooparts-claim` E=99,评的是麦田圈/机械装置确实存在), 而另一部分已证伪案例已改绑核心命题(如 `palenque-pakal-sarcophagus-lid` E=2、`sanxingdui-extraterrestrial-claim` E=3, 评的是外星读解本身)——两种取向下的 E 分不可横向比较。**统一方案待双人校准轮。** 2. **S 轴 §1.3 裁定与部分重审分数取向冲突**:`vaimanika-shastra` 重审后 S=12(按「主张所需的来源身份」评), 与 §1.3「S 跟随本站的描述」裁定(当时据此评 78)取向相反。统一方案同上,待双人校准轮。 --- ## 修订历史 | 版本 | 日期 | 变更 | |---|---|---| | v1.0 | 2026-07-25 | 初版。锚点案例表标注 ⚠️ 处待 P1 数据回归后定稿 | | v1.1 | 2026-07-26 | published 门禁修订(见 §0.0 v1.1 修订记录);锚点案例表 §6.1–6.5 按审计重审后分数更新(旧值见 git 历史);§6.6 标注为历史快照;新增 §11 已知问题(E 轴绑定不一致、§1.3 取向冲突) |