Evidence Wall / 2026

archive.dht / static evidence review

灰测路由证据链全景

我们将社区讨论中的接口字段、统计图表、同会话差异比对、可复现的输入规则及原始 Session 抓包,系统性地串联为一条完整的证据链。现有所有客观材料均高度指向:7 月与 8 月灰测并非同一模型路径;8 月流量强指向 Claude 请求链,且极大概率是 Opus 5。

【前置排除】一个常见误区:"模型无法接收文件或图片"并不能作为否定底层路由的证据。网关完全可以在请求到达底层模型前,直接拦截、清洗或丢弃附件;该现象仅能证明前端产品链路未将多模态数据透传给模型。
【灰测特征识别前提】请明确分辨什么是灰测特征:目前较容易客观分辨的表现,是较长的首字延迟(TTFT),以及总结式思维链以较大文本块间隔输出;请勿仅凭思维链的文字风格判断是否仍处于灰测。灰测回退后,DeepSeek 仍可能延续并模仿此前的表达特征。若没有原始会话、亲眼所见或完整视频等材料能够证明思维链的实际输出形态,请不要贸然断言模型没有生物安全拦截,或会话仍处于灰测状态并据此继续测试;无效证据会污染讨论环境。
【能力归因与证伪标准】欢迎提交反证:若您认为灰测模型的能力明显优于 Fable 系列或 Opus 5,请在干净会话(无历史上下文污染)中使用相同提示词进行对照,并提供可复现的截图或原始记录。本页拒绝仅凭主观体验下定论。

前端生成任务可作为有限的能力对照:在目前的外部公开样本中,标注为 Opus 5 的前端表现整体优于 Fable 对照组;但这仅能作为能力上限与候选排序的参考,无法单独作为锁定具体型号的直接铁证。

三条思维链输出路径并排对照

Opus 5 思维链输出
Opus 5总结式思维链,块状分段输出
灰测思维链输出
灰测模型总结式思维链,块状分段输出
灰测回退后流式思维链
灰测回退后部分模仿上文特征但逐 Token 流式
01 / Assessment

综合研判

先明确核心确定性结论,再划定证据尚未覆盖的边界。

Primary assessment

8 月灰测大概率指向 Opus 5

围绕 antml 标签的过滤机制、输入 Token 计量异常、截断边界及大小写无关性,多项物理规则共同锁定 Claude 风格请求处理链。至于时事知识、流式传输形态和安全拒答行为仅作为辅助证据。需要说明的是,现有公开材料尚无法百分之百锁定特定版本号,亦无法分辨其究竟是官方直连 API、第三方中转还是其他托管服务。

02 / Premises

分析方法论与前置定义

本报告基于系统级客观指标识别路由链路切换,而非主观猜测模型文风。

P01 / GREY PATH

灰测常态:摘要式思维链,大块分段输出

在稳定的灰测会话中,最显著的特征是系统先完成内部推理,再将思维链摘要以较大 Chunk 分段吐出。这与公开版"逐 Token 实时流式输出"的时序和分包形态有着本质区别。

P02 / FALLBACK

高危安全拦截:长延迟后降级为流式输出

当触发高危安全规则(如生物危害提问)时,系统并非直接报错中断,而是经历显著拉长的首字延迟(TTFT),随后切换为 DeepSeek 标志性的逐 Token 流式思维链;且该会话在此之后彻底脱离灰测,符合向 0813 V4 Pro 正式版的回退逻辑。

P03 / CONTEXT

排除上下文污染:被引导的公开版无法作为反例

如果公开版 DeepSeek 在历史上下文中已经接触到示例输出、特定角色设定或异常 Token,它会自然顺应上下文进行模仿。这种"上下文被污染后的复现"不具备独立鉴别力。同理,后续单次交互未能复现安全拦截,也不能推翻之前的路由记录。

证据准则:关键实验均保留有完整录屏或原始 Session 数据备查。任何支持或反对的论点,必须附带可供交叉验证的截图或日志,空口无凭者一律不予采纳。更高级别的反证需包含完整时间线、请求抓包或无剪辑视频。

提交正反证据
03 / Timeline

时间线划分

切忌混淆不同阶段的测试数据。8 月部分讨论可能引用了 7 月抓取的历史日志,缓存异常与底层聚类特征仅适用于 7 月阶段。

7 月旧版灰测

核心表现为固定的 64-Token 缓存截断重算、Reasoning Token 二次计数、TTFT-缓存-生成速率联合聚类,以及 logprobs 和 system_fingerprint 的底层差异。

8 月正式版复核

尝试在公开正式版中反向复现异常 Token、自主思考及特定输出特征。测试显示大量特征均无法稳定重现,证实公开正式版并未直接沿用 7 月旧灰测链路。

8 月新版灰测

前期暴露的假缓存数据已被修复。核心特征转变为 antml 相关的确定性解析规则、Session 维度的路由保持、大块摘要输出,以及高危生物提问触发的 Fallback 降级。

04 / Chain

完整证据链

每个节点仅承载其能直接证明的狭义结论,最终的型号推论建立在多节点的交叉印证之上。


E01 · AUGUST

antml 复现官方 Anthropic API 的确定性输入预处理

这里的“系统”不是模型权重,而是官方 Anthropic API 在模型分词前执行的标签预处理。灰测请求逐项复现了它最不自然的边界:只循环剥离开头的 antml:,遇到第一个不匹配前缀立即停手,后面的 antml: 不再处理;并且大小写不敏感。

Deterministic parser / one glance

不是“模型不想输出”——输入在到达模型前已经被改写

看这一条输入如何穿过官方 Anthropic API 的预处理规则:

用户发送
antml:antml:xxxxx:antml:payload
① antml:匹配开头
剥离
② antml:继续匹配
再次剥离
③ xxxxx:第一个不匹配
立即停止全部清洗
模型最终看到<xxxxx:antml:payload>
关键边界停止以后,后面的 antml: 原样保留
同一规则覆盖 32 种 ANTML 大小写组合,并由多名测试者独立复现。
技术展开 1:为什么“纯模型蒸馏学到了异常 Token”不成立?
  1. 32 种大小写组合全部触发:antml 五个字母共有 2⁵ = 32 种大小写排列,在常规 Tokenizer 中会对应不同的 Token 组合,却稳定触发同一种大小写无关规则。要用蒸馏解释,就必须额外假设训练数据定向覆盖了这套隐藏行为。
  2. 首个不匹配位置形成精确边界:系统只循环剥离开头连续的 antml:,遇到第一个非匹配前缀立即停止,停止后再出现的 antml: 原样保留。这是确定性词法状态机的边界,而不是概率生成中偶然漏掉字符串。
技术展开 2:为什么不是 Glitch Token?

无论在输入中叠加多少个 antml:
Anthropic 官方 API 返回的 input Token 数都一致。

如果它们作为普通或 Glitch Token 进入分词器,重复次数增加就应增加输入计数。计数完全不变,只能说明这些前缀在计量前已被剥离——问题发生在 API 预处理层,不是模型 Token 异常。
直接证明灰测输入在模型推理前经历了与官方 Anthropic API 同边界的 ANTML 预处理,强指向 Claude 请求链。
边界限定第三方理论上可以专门复刻这套规则;因此它证明请求链特征,不单独证明官方直连,也不能单独锁定具体型号。
阅读完整 ANTML 技术分析

E02 · JULY

固定 64-Token 缓存截断重算机制

64 Token 一块,是 DeepSeek 的正常机制。异常只看一件事:上下文刚加入数万 Token 的全新内容,未命中却仍然小于 64。下面直接看一个真实回合。

Raw session / VWXNvxEm / message 06

42 Token,装得下一整份 2,028 行程序?

上一回合刚生成一份完整的 game.js。到下一次请求,它第一次作为历史消息进入上下文;usage 却声称未命中只有 42 Token。

打开原始会话 ↗
上轮返回的 output Token41,827其中包含完整程序工具调用
新进入上下文的文件字符数86,699共 2,028 行 JavaScript
本轮缓存未命中 Token42usage 字段:input
本轮返回的 usage JSON · 原样字段
{
  "total": 96861,
  "input": 42,
  "output": 74,
  "reasoning": 1897,
  "cache": {
    "write": 0,
    "read": 94848
  }
}

▲ 页面所称“未命中”就是这里的 input: 42

本轮新增的历史输入game.js · 86,699 chars
1'use strict';
2/* ==================================
3   逆转法庭 ~午夜的钟声~
   NDS 风格网页游戏 · 原创剧本
   全部图形为程序化像素绘制
   ...
   function renderTop() { ... }
   function renderBtm() { ... }
   const Script = [ ... ];
   const CrossExams = { ... };
   ...
2025document.addEventListener('keydown',
2026  tryTitleMusic, { once: false });
2027
2028loop();

这不是用户只发了一个“继续”。这是上轮返回的完整 assistant message,其中仅代码就有 86,699 个字符;下一轮必须携带它才能继续会话。

Why exactly 42?
42 从哪来?它正好是总输入除以 64 后的余数
本轮总输入94,890cache.read 94,848 + input 42
÷ 64
1,482 个整块94,848usage 标成 cache.read
最后的尾数42usage 标成 input
94,890 = 1,482 × 64 + 42 → 返回数字一位不差
再核对刚新增的内容:上轮新输出 41,827 Token = 653 个整块 + 35;下一轮 cache.read 恰好增加 41,792 = 653 × 64。新内容的整块部分也被整体划进了“命中”。
正常机制DeepSeek 缓存
每 64 Token 一块
这很正常
但是
本轮实际结果新增 41,827 Token
未命中却只有 42
异常在这里
直接证明usage 没按实际缓存命中量统计,而是把总 Prompt 套入 64-Token 公式后重算
边界限定单个样本用于直观展示;总体规律仍依赖批量会话统计。该问题已修复,不适用于 8 月新灰测。
中高
E03 · AUGUST

现场演示:两条思维链输出路径不是同一种节奏

同样是模型开始写前端代码前的思考文本,灰测路径表现为高速突发输出,中间反复停顿;V4 正式公开版则是均匀、连续的较高速流式输出。点击播放,直接观察差异。

Live timing reconstruction

不要猜文风,直接看输出节奏

观察重点:左边看“突然出现一大段 → 长时间停住 → 再突然出现”;右边看持续匀速增长。

灰测思维链
高速突发 + 多次停顿
等待播放
较长停顿点每段结束约 2.6 秒;三个省略号短语后约 1.9 秒
V4 正式公开版
均匀、持续、较高速
等待播放
无额外停顿从开头到结尾保持恒定节奏
Raw recordings / same prompt演示之外,还有两段同题实测 GIF直接对照灰测的突发停顿与 DeepSeek 正式版的持续流式。

三条思维链 GIF 并排对照

Opus 5 思维链输出
Opus 5总结式思维链,块状分段输出
灰测思维链输出
灰测模型总结式思维链,块状分段输出
灰测回退后流式思维链
灰测回退后部分模仿上文特征但逐 Token 流式
推测与矛盾:假设 DS 训练了一个新模型,其使用摘要式思维链(事实),具有全新分词器(这是不吃脏 Token 的明显推论)。但是统计 Token 费用的时候,没有按照原始思维链来计费,而是按照摘要思维链来计费(事实),匪夷所思。并且使用原始分词器而非新分词器来统计 Token 数量,这与推论相矛盾。
直接证明两条路径存在肉眼可见的不同输出时序与缓冲方式
边界限定现场演示按原始观察重建节奏,并非原始 SSE 抓包;它用于解释现象,不能代替网络帧证据。
中高
E04 · JULY

Reasoning Token 与摘要思维链形成二选一两难

先记住两个同时成立的事实:

Fact 01 / 计数reasoning Token = 可见思维链经 DS 分词后的数量 + 2
Fact 02 / 输出思维链大块吐出;正文逐 Token 吐出,速度差巨大
可见思维链只能是下面两种之一——但选哪边都有问题
假设 A

它是摘要?

真实推理 ≠ 前端可见摘要但 usage 恰好 = 摘要长度 + 2
→ reasoning Token 被按摘要重算
假设 B

它是原始文本?

原始思维链应与正文同为 Token 流但实际是“大块高速” vs“正文逐 Token”
→ 可见思维链被缓冲或加工
无论选 A 还是 B:可见思维链与 usage 至少有一个经过了额外处理。
共同指向最简解释是网关拿到摘要或缓冲结果后,用 DeepSeek Tokenizer 重包装 reasoning Token
证据边界计数或速度单独看都不够;强度来自两者同时成立后形成的两难。

E05 · AUGUST

高危安全提问触发无缝降级(Fallback)

在稳定灰测会话中输入高危生物安全问题后,系统的输出模式突变为 DeepSeek 逐 Token 流式思维链,ANTML 前缀也不再被过滤,且该会话自此彻底脱离灰测。整个过程中 provider/model 响应头保持不变,底层时序与分块机制却已完全倒换。

识别提醒:回退后的思维链仍可能模仿上文思维链的部分文字特征。判断时应同时观察思维链的实际输出行为、TTFT,并在干净上下文中进行脏 Token 测试;脏 Token 测试与其他测试也可能受到上文结果污染。请理性区分,无法确定时可提交完整录屏供复核。
直接证明灰测上游在该类请求下触发熔断或拒绝,网关随后无缝降级回退至 0813 V4 Pro
边界限定单一安全提问并非通用的模型指纹;T4 噬菌体反例说明拦截取决于具体风险等级与上下文。

E06 · JULY

TTFT、缓存合法性与生成速率三维联合聚类

数据呈现明显的双峰分布:低延迟组生成速率约 200 字/秒且缓存数据正常;高延迟组生成速率约 80 字/秒且伴随假缓存。该证据的决定性在于延迟、缓存与生成速率三个独立维度同步分组,排除了单纯的"服务器排队"假象。

直接证明7 月系统底层至少存在两套物理处理链路或推理基础设施,并非同一集群在不同负载下的表现。
边界限定排队只能解释延迟,无法解释缓存逻辑与速率的同步聚类;但聚类本身仍无法直接为模型命名。
中高
E07 · JULY

API 能力与底层特征标识差异

常规请求可正常返回 logprobs 概率,而灰测请求该字段始终为空;system_fingerprint 初期与公开版有明显差异,后被人工统一为 V4P;流式传输时的分包与中文断句边界也展现出完全不同的封装特征。

直接证明两条路径在底层 API 能力、流式封装或后端配置上存在明确差异
边界限定相关字段可由代理网关伪造或修改,须与缓存及统计学证据结合研判。

E08 · AUGUST

时事知识仅作为候选收窄的辅助旁证

灰测模型展现出跨越至 2025 年 6 月乃至 10 月的知识切片,并在特定政界冷门考题中直接给出了 José Jerí 等最新信息。测试者本人亦明确指出"仅凭知识库无法定死型号"。

直接证明知识时效只能用于收窄候选范围,可为 Opus 5 排序提供辅助参考。
边界限定联网检索、RAG 外挂与后训练知识注入均会改变答案,无法据此绝对排除 Fable 5 或咬定 Opus 5。

E09 · CROSS-ROUND

V4 Pro 正式版反向测试必须基于空白上下文

在无历史记录的干净会话中,V4 Pro 正式版无法稳定通过全部异常 Token,多次测试均未出现正文固定输出,简单提问也不会像旧灰测那样跳过思考环节。被历史上下文引导后的"顺应模仿",不能作为有效反证

直接证明在空白会话受控变量下,7 月灰测与 V4 Pro 正式版存在显著差异
反证门槛有效证伪必须在全新会话、相同参数和相同 Prompt 下进行,并提供完整上下文截图;受污染会话的续写无效。
中高
E10 · SYNTHESIS

"7 月与 8 月非同一模型"是符合全部材料的最简解释

7 月核心特征是缓存截断重算、Reasoning Token 映射与基础设施聚类;8 月则转为 Claude 风格输入预处理与安全降级机制。两轮特征在多个技术维度上发生系统性断裂

综合判断7 月大概率属于 Fable;8 月极大概率属于 Opus 5
边界保持两轮测试的具体版本号均未获得官方层面的直接证实;8 月的具体接入渠道未知。

E11 · SUPPORTING

补充观察:Fork 后脱落灰测,原 Session 维持不变

在同一用户账号、同一时间节点下,原灰测 Session 继续对话仍能保持灰测;将其 Fork 成新会话后,新分支则落入公开版 DeepSeek 路径。这个现象与“灰测资格保存在 Session 上”相容,但并不具有强鉴别力。

有限观察Fork 后新会话可能重新决定灰测路由
为什么只列为低置信度正常灰度发布、A/B 测试也经常按 Session 分流;这一现象不能用于判断上游模型。
05 / Visual wall

截图证据全景

按实验测试簇分类归档,完整展示可供复核的原始材料。点击任意图片可查看高清大图。

Cluster A / July

两套独立基础设施

TTFT 只是切入点,与缓存合法性及生成速率构成的三维联合聚类才是核心证据。

7 月 TTFT 分布
TTFT 延迟分布呈现出偏离常规 DeepSeek 分布的双峰特征,用于后续交叉分组。
7 月基础设施聚类表
三维联合聚类缓存合法性、首字延迟与生成速率在同一批样本中呈现严格的同步分组。
Cluster B / August

antml 确定性规则

由主测试用例、DeepSeek 对照组、Token 计量差异、首错截断边界、大小写无关性及多方独立复现共同构成的完整逻辑闭环。

灰测 antml 主样本
灰测主样本表现未转义的特定标签未被当作普通文本渲染或计算。
普通 DS 对照
DeepSeek 正式版对照无法稳定复现该标签过滤与截断规则。
输入 token 对照一
Token 计量对照 A与图 B 形成严格变量对照。
输入 token 对照二
Token 计量对照 B重复拼接前缀时,并未按普通文本逻辑增加 Prompt Token 计数。
首个不匹配位置测试一
首错截断边界测试 A系统从第一个无法匹配前缀的字符位置开始向下输出。
首个不匹配位置测试二
首错截断边界测试 B验证了状态机截断规则的确定性,排除单次随机波动。
大小写无关测试
大小写无关性验证证明过滤行为属于系统级预处理,而非分词权重匹配。
第三方独立测试者复现
独立复现样本 1第三方测试者在稳定灰测 Session 中完整复现该行为。
第三方独立测试者再次复现
独立复现样本 2再次确认解析规则在独立环境中的高稳定性。
第三名参与者复现
第三方参与者复现提供了额外的侧面佐证。
Claude 转义对照
Claude 转义行为对照只要经过转义,Claude 与 DeepSeek 均能打印标签;因此"能否吐出标签"毫无鉴别意义,核心在于未转义标签被静默剥离及 Token 不增加的确定性规则。
Cluster C / Session

输出路径与 Fallback 降级

摘要块式、逐 Token 流式、分词边界及同会话状态切换构成了完整的链路证据。

8 月灰测摘要式思维链
摘要式大块思维链用于识别降级前的特征形态;单凭行文风格无法直接作为模型铁证。
0813 正式版逐 token 输出
0813 正式版基准链路常规 DeepSeek 的逐 Token 实时流式输出对照。
分词和流式边界对照
分词与 Chunk 截断旁证在中文断句和分包边界上与公开版 DeepSeek 存在明显偏差。
生物安全触发 fallback 的会话
高危安全提问降级实况稳定灰测会话在触发敏感问题后经历长 TTFT 才开始输出,思维链切换为流式,且仅该 Session 失去灰测。附原始 Session
T4 噬菌体反例
一般生物题反例并非所有生物学问题均会触发降级,证明拦截依赖于具体的安全风险等级与上下文。
Cluster D / Controls

正式版反测与上下文污染排除

干净对照证明公开版未继承 7 月特征;污染对照证明模型在上下文被诱导后会顺应模仿,该现象不能作为反证。

正式版脏 token 正文复现失败
空白会话:异常 Token 穿透失败公开正式版无法稳定复现 7 月灰测的正文穿透表现。
脏 token 只在思维链出现
空白会话:仅在思维链偶现与 7 月灰测在正文中稳定输出的表现存在本质差异。
正式版思考开关对照
思考模式对照公开正式版在极简问题下依然强制开启完整思考。
上下文污染前的对照
上下文污染实验 A模型在历史记录中已读取到目标设定与论证框架。
上下文污染后 DS 模仿输出
上下文污染实验 B公开版 DeepSeek 顺应上文输出了目标内容,证明"被污染后的模仿"不具备独立鉴别力。
Cluster E / Knowledge

知识切片仅作辅助参考

用于缩小模型候选集,不单独承担排除 Fable 5 或直接敲定 Opus 5 的证明任务。

2025 年 6 月知识测试
2025 年 6 月时事测试知识截止时间晚于部分候选基座模型。
2025 年 10 月知识测试
2025 年 10 月时事测试可辅助收窄候选集,但无法排除搜索增强或后训练注入。
秘鲁总统知识测试
秘鲁政界冷门知识灰测模型准确回答 José Jerí;在缺乏严格统一基准对照下,仅作背景参考。
06 / Matrix

证据矩阵

严格按照"证据在物理层面上能直接证明什么"进行评级,杜绝推论升级。

置信度时间线核心证据直接证明的结论主要边界与局限
8 月antml 过滤、Token、截断、大小写无关复现官方 Anthropic API 的输入预处理边界,强指向 Claude 请求链第三方理论上可主动复刻;无法证明官方直连或具体型号
7 月固定 64-Token 缓存重算usage/cache 字段经过人为重写,处理链不同仅适用于 7 月,无法据此命名上游
中高跨路径对照灰测突发停顿与 V4 均匀流式现场演示两条路径具有肉眼可见的不同输出时序与缓冲方式演示按观察重建,不等同于原始 SSE 抓包
中高7 月Reasoning Token 精确映射与摘要式分块输出计数、速度差与分块模式形成两难,usage 按可见摘要重算三项须结合使用,单项无法反推真实推理源头
8 月高危安全提问后突变流式并脱落灰测上游熔断后降级回退至 0813 V4 Pro 正式版安全拦截受具体 Prompt 风险等级调节
7 月TTFT、缓存、速率三维聚类底层存在至少两套物理推理链路或基础设施聚类统计无法直接反推模型版本号
中高7 月logprobs、fingerprint、delta 差异底层 API 接口能力、配置参数或封装存在差异网关代理层具备人为覆写这些字段的能力
8 月2025 年时事知识与冷门政界考题仅能作为收窄模型候选范围的辅助参考受联网检索、RAG 外挂与后训练知识影响极大
正式版对照空白会话下脏 Token 与免思考无法稳定复现公开正式版并未直接沿用 7 月旧灰测链路上下文被引导后的顺应模仿不构成有效反例
中高跨期对比多个独立技术维度发生系统性断裂7 月与 8 月绝非同一模型链路两轮测试的具体底层版本号均未被直接证明
8 月Fork 新会话脱落灰测,原 Session 维持新会话创建时可能重新决定灰测路由正常灰度发布也可出现,不具备模型鉴别力
中低全周期模型自述、行文文风、标点偏好、猜数字仅作为行为相似性的背景观察易受 Prompt 注入与微调影响,不入核心证据链
07 / Boundaries

必须保留的技术边界

划定边界不是削弱证据的说服力,而是防止将局部事实过度解读为绝对结论。

64-Token 缓存截断仅存在于 7 月数据中:8 月新一轮灰测中,该伪造缓存的特征已被系统性修复,切勿混淆两期数据。
antml 规则仅证明流量经过了 Claude 风格的处理管线:第三方中转层或反代兼容层同样有能力人工实现这套规则,不能直接等同于官方直连。
大小写无关性排除了"纯模型权重蒸馏"假说:但这只能证明存在前置文本解析层,无法排除网关处人为部署了大小写不敏感状态机的可能。
单纯"模型输出了特定标签"不构成有效判据:Claude 与 DeepSeek 均可在合理转义下输出此类文本;关键判据在于未转义裸输入在网关和分词阶段的确定性处理逻辑。
知识题无法咬定 Opus 5,亦不能排除 Fable 5:基座模型的最终确认必须结合请求管线特征、分词逻辑及系统级交互行为综合研判。
单一首字延迟(TTFT)不能作为判断模型的指纹:只有当延迟、缓存合法性与生成速率三者发生强关联聚类时,才具备证据价值。
模型自述与语言风格仅作参考背景:System Prompt 注入、角色设定、蒸馏对齐及后训练微调均能彻底扭转大模型的外在行文表象。
"无法接收文件或图片"不构成反向否定证据:产品接入层完全可能在请求到达模型前主动拦截、丢弃或不透传多模态附件。
8 月高危生物提问并非直接被拒:实际观测到的是经历显著长延迟后降级为 DeepSeek 流式输出,并伴随整个会话永久脱离灰测状态。
严禁将历史上下文污染后的模型模仿视为反例:当公开模型在上文中已读取到特定 Token、角色或逻辑结构时,其延续生成的行为纯属正常预测,在缺乏空白会话对照的前提下不具备鉴别力。
后续单次交互未能复现安全拦截,不能推翻既有路由事实:触发行为受上下文、会话所处状态及具体 Prompt 扰动影响极大,必须控制变量严谨复测。
Fork 后脱落灰测不是模型指纹:正常灰度发布和 A/B 测试也可能在新 Session 创建时重新分流;该现象仅作会话路由状态的补充观察,不进入核心型号归因。
调用渠道、托管方式与底层商业动机尚不在可证实范围内:现有纯技术抓包证据仅能证明链路行为,无法直接穿透至商业合作模式、具体数据流向或实体部署方式。
08 / Method

样本来源与收录准则

样本覆盖范围

本报告基于本地 archive.dht 完整镜像。对社区核心讨论线程(包括 N一串 的 211 条发言及楼主的 237 条核心消息)进行了逐项推演与交叉验证,并补入了测试者 mitu9527 提交的独立 antml 复现日志、生物安全 Fallback 降级记录与原始会话抓包数据。

为保证论证的严肃性与专注度,本页仅精简收录核心证据链相关材料,剥离了非技术性的外部跳转。绝大多数关键实验均留存有完整的录屏及会话原始文件备查。

材料收录原则

  • 截图、网络日志与可量化指标的权重严格高于口述回忆。
  • 任何支持或反对的论点,必须附带至少一张可供核验的原始截图;无客观凭证的言论一律不入链。
  • 属于同一实验的连续截图按测试簇集中归档,呈现完整上下文。
  • 剔除一切重复转发、情绪化发泄、表情包及无意义的商业动机争论。
  • 反例必须严格控制会话状态、上下文及提示词变量;被污染后的模仿不具备反证效力。
  • 置信度评级仅衡量材料对狭义技术结论的支持强度,对事不对人。

下载灰测原始会话 Session ZIP · 下载生物安全 fallback 原始 Session ZIP · 提交证据或评论