Evidence Wall / 2026

archive.dht / static evidence review

灰测路由证据链全景

我们将社区讨论中的接口字段、统计图表、同会话差异比对、可复现的输入规则及原始 Session 抓包,系统性地串联为一条完整的证据链。现有所有客观材料均高度指向:7 月与 8 月灰测并非同一模型路径;8 月流量强指向 Claude 请求链,且极大概率是 Opus 5。

【前置排除】一个常见误区:"模型无法接收文件或图片"并不能作为否定底层路由的证据。网关完全可以在请求到达底层模型前,直接拦截、清洗或丢弃附件;该现象仅能证明前端产品链路未将多模态数据透传给模型。
【能力归因与证伪标准】欢迎提交反证:若您认为灰测模型的能力明显优于 Fable 系列或 Opus 5,请在干净会话(无历史上下文污染)中使用相同提示词进行对照,并提供可复现的截图或原始记录。本页拒绝仅凭主观体验下定论。

前端生成任务可作为有限的能力对照:在目前的外部公开样本中,标注为 Opus 5 的前端表现整体优于 Fable 对照组;但这仅能作为能力上限与候选排序的参考,无法单独作为锁定具体型号的直接铁证。

01 / Assessment

综合研判

先明确核心确定性结论,再划定证据尚未覆盖的边界。

Primary assessment

8 月灰测大概率指向 Opus 5

围绕 antml 标签的过滤机制、输入 Token 计量异常、截断边界及大小写无关性,多项物理规则共同锁定了 Claude 风格的请求处理链。至于时事知识、流式传输形态和安全拒答行为仅作为辅助证据。需要说明的是,现有公开材料尚无法百分之百锁定特定版本号,亦无法分辨其究竟是官方直连 API、第三方中转还是其他托管服务。

02 / Premises

分析方法论与前置定义

本报告基于系统级客观指标识别路由链路切换,而非主观猜测模型文风。

P01 / GREY PATH

灰测常态:摘要式思维链,大块分段输出

在稳定的灰测会话中,最显著的特征是系统先完成内部推理,再将思维链摘要以较大 Chunk(数据块)分段吐出。这与公开版"逐 Token 实时流式输出"的时序和分包形态有着本质区别。

P02 / FALLBACK

高危安全拦截:长延迟后降级为流式输出

当触发高危安全规则(如生物危害提问)时,系统并非直接报错中断,而是经历显著拉长的首字延迟(TTFT),随后切换为 DeepSeek 标志性的逐 Token 流式思维链;且该会话在此之后彻底脱离灰测,符合向 0813 V4 Pro 正式版的回退逻辑。

P03 / CONTEXT

排除上下文污染:被引导的公开版无法作为反例

如果公开版 DeepSeek 在历史上下文中已经接触到示例输出、特定角色设定或异常 Token,它会自然顺应上下文进行模仿。这种"上下文被污染后的复现"不具备独立鉴别力。同理,后续单次交互未能复现安全拦截,也不能推翻之前的路由记录。有效比对必须基于全新的空白会话及相同提示词。

证据准则:关键实验均保留有完整录屏或原始 Session 数据备查。任何支持或反对的论点,必须附带可供交叉验证的截图或日志,空口无凭者一律不予采纳。更高级别的反证需包含完整时间线、请求抓包或无剪辑视频。

提交正反证据
03 / Timeline

时间线划分

切忌混淆不同阶段的测试数据。8 月部分讨论可能引用了 7 月抓取的历史日志,缓存异常与底层聚类特征仅适用于 7 月阶段。

7 月旧版灰测

核心表现为固定的 64-Token 缓存截断重算、Reasoning Token 二次计数、TTFT-缓存-生成速率联合聚类,以及 logprobs 和 system_fingerprint 的底层差异。

8 月正式版复核

尝试在公开正式版中反向复现异常 Token、自主思考及特定输出特征。测试显示大量特征均无法稳定重现,证实公开正式版并未直接沿用 7 月旧灰测链路。

8 月新版灰测

前期暴露的假缓存数据已被修复。核心特征转变为 antml 相关的确定性解析规则、Session 维度的路由保持、大块摘要输出,以及高危生物提问触发的 Fallback 降级。

04 / Chain

完整证据链

每个节点仅承载其能直接证明的狭义结论,最终的型号推论建立在多节点的交叉印证之上。


E01 · JULY

固定 64-Token 缓存截断重算机制

旧灰测中,未命中缓存(cache_miss)的输入长度严格小于 64,命中缓存(cache_hit)则恒为 64 的整数倍,完全契合公式 hit = floor(input / 64) * 64。真实的大模型推理服务会返回实际物理命中量,绝不会机械地按 64 粒度强行切分。

直接证明7 月的 usage/cache 字段经过了人为或网关层的特殊重算,其处理链路与常规 DeepSeek 不同。
边界限定无法由此直接推导上游模型身份;该规律已被修复,不适用于 8 月新灰测。
"所有非 cache 的 input token 全都小于 64""命中 = 下取整(input/64)×64""8 月明显假的缓存数据修好了"

E02 · JULY

TTFT、缓存合法性与生成速率三维联合聚类

数据呈现明显的双峰分布:低延迟组生成速率约 200 字/秒且缓存数据正常;高延迟组生成速率约 80 字/秒且伴随假缓存。该证据的决定性在于三个独立维度的强关联共振,排除了单纯的"服务器排队"假象。

直接证明7 月系统底层至少存在两套物理处理链路或推理基础设施,并非同一集群在不同负载下的表现。
边界限定排队只能解释延迟,无法解释缓存逻辑与速率的同步聚类;但聚类本身仍无法直接为模型命名。
中高
E03 · JULY

推理 Token 对可见思维链文本二次计数

接口返回的推理 Token 数量,严格等于将前端可见思维链文本代入 DeepSeek Tokenizer 计算后的长度 + 2。结合伪造缓存的现象,高度指向网关层在拿到上游生成的思维链摘要后,使用自身分词器重新包装了 usage 字段。

直接证明usage 字段存在由 DeepSeek 端发起的重新计量行为,符合协议转换层的特征。
边界限定重新计数的现象本身无法反推思维链摘要的真实生成源头。
中高
E04 · JULY

API 能力与底层特征标识差异

常规请求可正常返回 logprobs 概率,而灰测请求该字段始终为空;system_fingerprint 初期与公开版有明显差异,后被人工统一为 V4P;流式传输时的分包与中文断句边界也展现出完全不同的封装特征。

直接证明两条路径在底层 API 能力、流式封装机制或后端环境配置上存在明确差异。
边界限定相关字段可由代理网关伪造或修改,须与缓存及统计学证据结合研判。

E05 · AUGUST

antml 呈现确定性的请求预处理与状态机规则

系统对包含 antml 标签的文本展现出一套强特征的确定性解析状态机:未转义的标签会被直接剔除;重复拼接前缀不会按常规增加计费 Token;局部篡改后会从第一个不匹配的字符起开始吐字;且整套规则对英文大小写不敏感。该现象已被 mitu9527 与另一参与者完全复现。

直接证明8 月请求在进入底层模型分词前或在协议解析层经历了 Claude 风格的特征处理,强指向 Claude 请求链。
边界限定第三方兼容层理论上可主动复刻该规则;仅凭此无法证明其为官方直连 API,亦无法锁定具体型号。
技术展开:为什么纯"模型蒸馏学到了异常 Token"的解释不成立?
  1. 模型权重无法篡改输入计量:若标签作为普通文本传入,必须先经历分词并计入 Prompt Token。模型生成阶段的任何反应,都不可能让已经进入上下文的字符在计量上凭空蒸发。
  2. 大小写敏感度存在本质差异:antmlANTML 及大小写混写在常规 Tokenizer 中对应完全不同的 Token ID,纯靠被动蒸馏无法天然获得覆盖所有排列组合的全局过滤规则。
  3. 首个不匹配位置反映了确定性状态机:"逐字符对比前缀、剥离匹配项、遇错立刻截断并输出剩余部分"的逻辑,完全是词法解析器的标准编程行为,而非大模型的概率性 Token 预测。
  4. 核心现象发生在模型推理之前:从 Token 计量到大小写规范化,所有特征均发生在实际生成之前的网络协议与预处理层。

唯一合理的保留解释:第三方中转或兼容层人为实现了同样的过滤规则。因此该证据锁定了请求链特征,但不证明具体的采购或调用渠道。


E06 · AUGUST

会话分支(Fork)导致灰测脱落,原 Session 维持不变

在同一用户账号、同一时间节点下,在原有灰测 Session 中继续对话仍能保持灰测;但一旦将其 Fork 为新会话,新分支立即跌落为公开版 DeepSeek 路径。

直接证明灰测路由状态绑定在具体的 Session 会话生命周期上,而非单纯按账号或全局请求分配。
边界限定仅能证明会话级路由机制,无法据此反推上游模型身份或路由分流的业务动机。
"fork session 会掉灰测""原 session 继续聊还会在""fork 的变成了 DS"

E07 · AUGUST

高危安全提问触发无缝降级(Fallback)

在稳定的灰测会话中输入高危生物安全问题后,系统在经历约 15 秒的异常长 TTFT 后,输出模式突变为 DeepSeek 逐 Token 流式思维链,且该会话自此彻底脱离灰测。抓包显示整个过程中 provider/model 响应头保持不变,但底层时序与分块机制已完全倒换。

直接证明灰测上游在该类请求下触发了熔断或拒绝,网关随后将请求无缝降级回退至 0813 V4 Pro 正式版。
边界限定单一安全提问并非通用的模型指纹;T4 噬菌体反例说明拦截取决于具体风险等级与上下文。
"思维链变成流式了""一问生物甲就没了""首字 15 秒,切了 DS 流式思维链"
中高
E08 · AUGUST

思维链输出形态与分词边界的多路径佐证

灰测链路呈现出明显的"大块摘要式"思维链推送,公开版则是"单字实时流式";两者在部分中文词汇的切分边界与 Chunk 截断上也存在可观测的差异,与 Fallback 及 Fork 现象形成互证。

直接证明系统内部确实存在完全不同的流式封装、分词处理或输出管线。
边界限定截图缺少完整的原始 SSE 抓包帧;视觉分块与文风不可单独作为判定模型的依据。

E09 · CROSS-ROUND

V4 Pro 正式版反向测试必须基于空白上下文

在无历史记录的干净会话中,V4 Pro 正式版无法稳定通过全部异常 Token,多次测试均未出现正文固定输出,简单提问也不会像旧灰测那样跳过思考环节。任何在已被历史信息污染的会话中完成的"顺应模仿",都不能作为否定路由差异的有效反证。

直接证明在空白会话受控变量下,7 月灰测与后续 V4 Pro 正式版的 Tokenizer 处理、后训练或路由策略存在显著差异。
反证门槛有效证伪必须在全新会话、相同参数和相同 Prompt 下进行,并提供完整上下文截图;受污染会话的续写无效。

E10 · AUGUST

时事知识仅作为候选收窄的辅助旁证

灰测模型展现出跨越至 2025 年 6 月乃至 10 月的知识切片,并在特定政界冷门考题中直接给出了 José Jerí 等最新信息。测试者本人亦明确指出"仅凭知识库无法定死型号"。

直接证明知识时效可用于收窄候选模型范围,为锁定 Opus 5 提供辅助侧面证据。
边界限定联网检索、RAG 外挂与后训练知识注入均会改变答案,无法据此绝对排除 Fable 5 或咬定 Opus 5。
中高
E11 · SYNTHESIS

"7 月与 8 月非同一模型"是符合全部材料的最简解释

7 月的核心特征在于缓存截断重算、Reasoning Token 映射与基础设施聚类;8 月则彻底修补了缓存漏洞,显现为 Claude 风格的输入预处理、会话级路由状态与安全降级机制。两者在多个技术维度上呈现出互不重叠的系统性差异。

综合判断7 月大概率属于 Fable 系列;8 月极大概率属于 Opus 5。
边界保持两轮测试的具体版本号均未获得官方层面的直接证实;8 月的具体接入渠道未知。
"和七月应该不是一个""七月可能是 Fable""知识库没法锤"
05 / Visual wall

截图证据全景

按实验测试簇分类归档,完整展示可供复核的原始材料。点击任意图片可查看高清大图。

Cluster A / July

两套独立基础设施

TTFT 只是切入点,与缓存合法性及生成速率构成的三维联合聚类才是核心证据。

7 月 TTFT 分布
TTFT 延迟分布呈现出偏离常规 DeepSeek 分布的双峰特征,用于后续交叉分组。
7 月基础设施聚类表
三维联合聚类缓存合法性、首字延迟与生成速率在同一批样本中呈现严格的同步分组。
Cluster B / August

antml 确定性规则

由主测试用例、DeepSeek 对照组、Token 计量差异、首错截断边界、大小写无关性及多方独立复现共同构成的完整逻辑闭环。

灰测 antml 主样本
灰测主样本表现未转义的特定标签未被当作普通文本渲染或计算。
普通 DS 对照
DeepSeek 正式版对照无法稳定复现该标签过滤与截断规则。
输入 token 对照一
Token 计量对照 A与图 B 形成严格变量对照。
输入 token 对照二
Token 计量对照 B重复拼接前缀时,并未按普通文本逻辑增加 Prompt Token 计数。
首个不匹配位置测试一
首错截断边界测试 A系统从第一个无法匹配前缀的字符位置开始向下输出。
首个不匹配位置测试二
首错截断边界测试 B验证了状态机截断规则的确定性,排除单次随机波动。
大小写无关测试
大小写无关性验证证明过滤行为属于系统级预处理,而非分词权重匹配。
mitu9527 独立复现
独立复现样本 1第三方测试者在稳定灰测 Session 中完整复现该行为。
mitu9527 再次复现
独立复现样本 2再次确认解析规则在独立环境中的高稳定性。
第三名参与者复现
第三方参与者复现提供了额外的侧面佐证。
Claude 转义对照
Claude 转义行为对照只要经过转义,Claude 与 DeepSeek 均能打印标签;因此"能否吐出标签"毫无鉴别意义,核心在于未转义标签被静默剥离及 Token 不增加的确定性规则。
Cluster C / Session

输出路径与 Fallback 降级

摘要块式、逐 Token 流式、分词边界及同会话状态切换构成了完整的链路证据。

8 月灰测摘要式思维链
摘要式大块思维链用于识别降级前的特征形态;单凭行文风格无法直接作为模型铁证。
0813 正式版逐 token 输出
0813 正式版基准链路常规 DeepSeek 的逐 Token 实时流式输出对照。
分词和流式边界对照
分词与 Chunk 截断旁证在中文断句和分包边界上与公开版 DeepSeek 存在明显偏差。
生物安全触发 fallback 的会话
高危安全提问降级实况稳定灰测会话在触发敏感问题后切换为流式并永久失去灰测,附原始抓包 ZIP。
T4 噬菌体反例
一般生物题反例并非所有生物学问题均会触发降级,证明拦截依赖于具体的安全风险等级与上下文。
Cluster D / Controls

正式版反测与上下文污染排除

干净对照证明公开版未继承 7 月特征;污染对照证明模型在上下文被诱导后会顺应模仿,该现象不能作为反证。

正式版脏 token 正文复现失败
空白会话:异常 Token 穿透失败公开正式版无法稳定复现 7 月灰测的正文穿透表现。
脏 token 只在思维链出现
空白会话:仅在思维链偶现与 7 月灰测在正文中稳定输出的表现存在本质差异。
正式版思考开关对照
思考模式对照公开正式版在极简问题下依然强制开启完整思考。
上下文污染前的对照
上下文污染实验 A模型在历史记录中已读取到目标设定与论证框架。
上下文污染后 DS 模仿输出
上下文污染实验 B公开版 DeepSeek 顺应上文输出了目标内容,证明"被污染后的模仿"不具备独立鉴别力。
Cluster E / Knowledge

知识切片仅作辅助参考

用于缩小模型候选集,不单独承担排除 Fable 5 或直接敲定 Opus 5 的证明任务。

2025 年 6 月知识测试
2025 年 6 月时事测试知识截止时间晚于部分候选基座模型。
2025 年 10 月知识测试
2025 年 10 月时事测试可辅助收窄候选集,但无法排除搜索增强或后训练注入。
秘鲁总统知识测试
秘鲁政界冷门知识灰测模型准确回答 José Jerí;在缺乏严格统一基准对照下,仅作背景参考。
06 / Matrix

证据矩阵

严格按照"证据在物理层面上能直接证明什么"进行评级,杜绝推论升级。

置信度时间线核心证据直接证明的结论主要边界与局限
7 月固定 64-Token 缓存重算usage/cache 字段经过人为重写,处理链不同仅适用于 7 月,无法据此命名上游
7 月TTFT、缓存、速率三维聚类底层存在至少两套物理推理链路或基础设施聚类统计无法直接反推模型版本号
中高7 月Reasoning Token 长度二次映射可见思维链经由 DeepSeek Tokenizer 重新计量无法反推原始思维链摘要的来源
中高7 月logprobs、fingerprint、delta 差异底层 API 接口能力、配置参数或封装存在差异网关代理层具备人为覆写这些字段的能力
8 月antml 过滤、Token、截断、大小写无关完全符合 Claude 请求链特征,且经多方复现无法证明是否为官方直连,无法咬定具体型号
8 月Fork 新会话脱落灰测,原 Session 维持路由状态严格绑定在 Session 会话生命周期上无法识别路由背后的具体业务动机
8 月高危安全提问后突变流式并脱落灰测上游熔断后降级回退至 0813 V4 Pro 正式版安全拦截受具体 Prompt 风险等级调节
中高8 月摘要块式、逐 Token 流式与分词断句存在完全不同的流式推送机制与输出处理路径缺少完整的网络层原始 SSE 数据帧
正式版对照空白会话下脏 Token 与免思考无法稳定复现公开正式版并未直接沿用 7 月旧灰测链路上下文被引导后的顺应模仿不构成有效反例
8 月2025 年时事知识与冷门政界考题仅能作为收窄模型候选范围的辅助参考受联网检索、RAG 外挂与后训练知识影响极大
中高跨期对比多个独立技术维度发生系统性断裂7 月与 8 月绝非同一模型链路两轮测试的具体底层版本号均未被直接证明
中低全周期模型自述、行文文风、标点偏好、猜数字仅作为行为相似性的背景观察易受 Prompt 注入与微调影响,不入核心证据链
07 / Boundaries

必须保留的技术边界

划定边界不是削弱证据的说服力,而是防止将局部事实过度解读为绝对结论。

64-Token 缓存截断仅存在于 7 月数据中:8 月新一轮灰测中,该伪造缓存的特征已被系统性修复,切勿混淆两期数据。
antml 规则仅证明流量经过了 Claude 风格的处理管线:第三方中转层或反代兼容层同样有能力人工实现这套规则,不能直接等同于官方直连。
大小写无关性排除了"纯模型权重蒸馏"假说:但这只能证明存在前置文本解析层,无法排除网关处人为部署了大小写不敏感状态机的可能。
单纯"模型输出了特定标签"不构成有效判据:Claude 与 DeepSeek 均可在合理转义下输出此类文本;关键判据在于未转义裸输入在网关和分词阶段的确定性处理逻辑。
知识题无法咬定 Opus 5,亦不能排除 Fable 5:基座模型的最终确认必须结合请求管线特征、分词逻辑及系统级交互行为综合研判。
单一首字延迟(TTFT)不能作为判断模型的指纹:只有当延迟、缓存合法性与生成速率三者发生强关联聚类时,才具备证据价值。
模型自述与语言风格仅作参考背景:System Prompt 注入、角色设定、蒸馏对齐及后训练微调均能彻底扭转大模型的外在行文表象。
"无法接收文件或图片"不构成反向否定证据:产品接入层完全可能在请求到达模型前主动拦截、丢弃或不透传多模态附件。
8 月高危生物提问并非直接被拒:实际观测到的是经历显著长延迟后降级为 DeepSeek 流式输出,并伴随整个会话永久脱离灰测状态。
严禁将历史上下文污染后的模型模仿视为反例:当公开模型在上文中已读取到特定 Token、角色或逻辑结构时,其延续生成的行为纯属正常预测,在缺乏空白会话对照的前提下不具备鉴别力。
后续单次交互未能复现安全拦截,不能推翻既有路由事实:触发行为受上下文、会话所处状态及具体 Prompt 扰动影响极大,必须控制变量严谨复测。
调用渠道、托管方式与底层商业动机尚不在可证实范围内:现有纯技术抓包证据仅能证明链路行为,无法直接穿透至商业合作模式、具体数据流向或实体部署方式。
08 / Method

样本来源与收录准则

样本覆盖范围

本报告基于本地 archive.dht 完整镜像。对社区核心讨论线程(包括 N一串 的 211 条发言及楼主的 237 条核心消息)进行了逐项推演与交叉验证,并补入了测试者 mitu9527 提交的独立 antml 复现日志、生物安全 Fallback 降级记录与原始会话抓包数据。

为保证论证的严肃性与专注度,本页仅精简收录核心证据链相关材料,剥离了非技术性的外部跳转。绝大多数关键实验均留存有完整的录屏及会话原始文件备查。

材料收录原则

  • 截图、网络日志与可量化指标的权重严格高于口述回忆。
  • 任何支持或反对的论点,必须附带至少一张可供核验的原始截图;无客观凭证的言论一律不入链。
  • 属于同一实验的连续截图按测试簇集中归档,呈现完整上下文。
  • 剔除一切重复转发、情绪化发泄、表情包及无意义的商业动机争论。
  • 反例必须严格控制会话状态、上下文及提示词变量;被污染后的模仿不具备反证效力。
  • 置信度评级仅衡量材料对狭义技术结论的支持强度,对事不对人。

下载生物安全 fallback 原始 session ZIP · 提交证据或评论