8 月灰测大概率指向 Opus 5
围绕 antml 标签的过滤机制、输入 Token 计量异常、截断边界及大小写无关性,多项物理规则共同锁定了 Claude 风格的请求处理链。至于时事知识、流式传输形态和安全拒答行为仅作为辅助证据。需要说明的是,现有公开材料尚无法百分之百锁定特定版本号,亦无法分辨其究竟是官方直连 API、第三方中转还是其他托管服务。
archive.dht / static evidence review
我们将社区讨论中的接口字段、统计图表、同会话差异比对、可复现的输入规则及原始 Session 抓包,系统性地串联为一条完整的证据链。现有所有客观材料均高度指向:7 月与 8 月灰测并非同一模型路径;8 月流量强指向 Claude 请求链,且极大概率是 Opus 5。
前端生成任务可作为有限的能力对照:在目前的外部公开样本中,标注为 Opus 5 的前端表现整体优于 Fable 对照组;但这仅能作为能力上限与候选排序的参考,无法单独作为锁定具体型号的直接铁证。
先明确核心确定性结论,再划定证据尚未覆盖的边界。
围绕 antml 标签的过滤机制、输入 Token 计量异常、截断边界及大小写无关性,多项物理规则共同锁定了 Claude 风格的请求处理链。至于时事知识、流式传输形态和安全拒答行为仅作为辅助证据。需要说明的是,现有公开材料尚无法百分之百锁定特定版本号,亦无法分辨其究竟是官方直连 API、第三方中转还是其他托管服务。
本报告基于系统级客观指标识别路由链路切换,而非主观猜测模型文风。
在稳定的灰测会话中,最显著的特征是系统先完成内部推理,再将思维链摘要以较大 Chunk(数据块)分段吐出。这与公开版"逐 Token 实时流式输出"的时序和分包形态有着本质区别。
当触发高危安全规则(如生物危害提问)时,系统并非直接报错中断,而是经历显著拉长的首字延迟(TTFT),随后切换为 DeepSeek 标志性的逐 Token 流式思维链;且该会话在此之后彻底脱离灰测,符合向 0813 V4 Pro 正式版的回退逻辑。
如果公开版 DeepSeek 在历史上下文中已经接触到示例输出、特定角色设定或异常 Token,它会自然顺应上下文进行模仿。这种"上下文被污染后的复现"不具备独立鉴别力。同理,后续单次交互未能复现安全拦截,也不能推翻之前的路由记录。有效比对必须基于全新的空白会话及相同提示词。
证据准则:关键实验均保留有完整录屏或原始 Session 数据备查。任何支持或反对的论点,必须附带可供交叉验证的截图或日志,空口无凭者一律不予采纳。更高级别的反证需包含完整时间线、请求抓包或无剪辑视频。
提交正反证据切忌混淆不同阶段的测试数据。8 月部分讨论可能引用了 7 月抓取的历史日志,缓存异常与底层聚类特征仅适用于 7 月阶段。
核心表现为固定的 64-Token 缓存截断重算、Reasoning Token 二次计数、TTFT-缓存-生成速率联合聚类,以及 logprobs 和 system_fingerprint 的底层差异。
尝试在公开正式版中反向复现异常 Token、自主思考及特定输出特征。测试显示大量特征均无法稳定重现,证实公开正式版并未直接沿用 7 月旧灰测链路。
前期暴露的假缓存数据已被修复。核心特征转变为 antml 相关的确定性解析规则、Session 维度的路由保持、大块摘要输出,以及高危生物提问触发的 Fallback 降级。
每个节点仅承载其能直接证明的狭义结论,最终的型号推论建立在多节点的交叉印证之上。
旧灰测中,未命中缓存(cache_miss)的输入长度严格小于 64,命中缓存(cache_hit)则恒为 64 的整数倍,完全契合公式 hit = floor(input / 64) * 64。真实的大模型推理服务会返回实际物理命中量,绝不会机械地按 64 粒度强行切分。
数据呈现明显的双峰分布:低延迟组生成速率约 200 字/秒且缓存数据正常;高延迟组生成速率约 80 字/秒且伴随假缓存。该证据的决定性在于三个独立维度的强关联共振,排除了单纯的"服务器排队"假象。
接口返回的推理 Token 数量,严格等于将前端可见思维链文本代入 DeepSeek Tokenizer 计算后的长度 + 2。结合伪造缓存的现象,高度指向网关层在拿到上游生成的思维链摘要后,使用自身分词器重新包装了 usage 字段。
常规请求可正常返回 logprobs 概率,而灰测请求该字段始终为空;system_fingerprint 初期与公开版有明显差异,后被人工统一为 V4P;流式传输时的分包与中文断句边界也展现出完全不同的封装特征。
antml 呈现确定性的请求预处理与状态机规则系统对包含 antml 标签的文本展现出一套强特征的确定性解析状态机:未转义的标签会被直接剔除;重复拼接前缀不会按常规增加计费 Token;局部篡改后会从第一个不匹配的字符起开始吐字;且整套规则对英文大小写不敏感。该现象已被 mitu9527 与另一参与者完全复现。
antml、ANTML 及大小写混写在常规 Tokenizer 中对应完全不同的 Token ID,纯靠被动蒸馏无法天然获得覆盖所有排列组合的全局过滤规则。唯一合理的保留解释:第三方中转或兼容层人为实现了同样的过滤规则。因此该证据锁定了请求链特征,但不证明具体的采购或调用渠道。
在同一用户账号、同一时间节点下,在原有灰测 Session 中继续对话仍能保持灰测;但一旦将其 Fork 为新会话,新分支立即跌落为公开版 DeepSeek 路径。
在稳定的灰测会话中输入高危生物安全问题后,系统在经历约 15 秒的异常长 TTFT 后,输出模式突变为 DeepSeek 逐 Token 流式思维链,且该会话自此彻底脱离灰测。抓包显示整个过程中 provider/model 响应头保持不变,但底层时序与分块机制已完全倒换。
灰测链路呈现出明显的"大块摘要式"思维链推送,公开版则是"单字实时流式";两者在部分中文词汇的切分边界与 Chunk 截断上也存在可观测的差异,与 Fallback 及 Fork 现象形成互证。
在无历史记录的干净会话中,V4 Pro 正式版无法稳定通过全部异常 Token,多次测试均未出现正文固定输出,简单提问也不会像旧灰测那样跳过思考环节。任何在已被历史信息污染的会话中完成的"顺应模仿",都不能作为否定路由差异的有效反证。
灰测模型展现出跨越至 2025 年 6 月乃至 10 月的知识切片,并在特定政界冷门考题中直接给出了 José Jerí 等最新信息。测试者本人亦明确指出"仅凭知识库无法定死型号"。
7 月的核心特征在于缓存截断重算、Reasoning Token 映射与基础设施聚类;8 月则彻底修补了缓存漏洞,显现为 Claude 风格的输入预处理、会话级路由状态与安全降级机制。两者在多个技术维度上呈现出互不重叠的系统性差异。
按实验测试簇分类归档,完整展示可供复核的原始材料。点击任意图片可查看高清大图。
TTFT 只是切入点,与缓存合法性及生成速率构成的三维联合聚类才是核心证据。


antml 确定性规则由主测试用例、DeepSeek 对照组、Token 计量差异、首错截断边界、大小写无关性及多方独立复现共同构成的完整逻辑闭环。











摘要块式、逐 Token 流式、分词边界及同会话状态切换构成了完整的链路证据。





干净对照证明公开版未继承 7 月特征;污染对照证明模型在上下文被诱导后会顺应模仿,该现象不能作为反证。





用于缩小模型候选集,不单独承担排除 Fable 5 或直接敲定 Opus 5 的证明任务。



严格按照"证据在物理层面上能直接证明什么"进行评级,杜绝推论升级。
| 置信度 | 时间线 | 核心证据 | 直接证明的结论 | 主要边界与局限 |
|---|---|---|---|---|
| 高 | 7 月 | 固定 64-Token 缓存重算 | usage/cache 字段经过人为重写,处理链不同 | 仅适用于 7 月,无法据此命名上游 |
| 高 | 7 月 | TTFT、缓存、速率三维聚类 | 底层存在至少两套物理推理链路或基础设施 | 聚类统计无法直接反推模型版本号 |
| 中高 | 7 月 | Reasoning Token 长度二次映射 | 可见思维链经由 DeepSeek Tokenizer 重新计量 | 无法反推原始思维链摘要的来源 |
| 中高 | 7 月 | logprobs、fingerprint、delta 差异 | 底层 API 接口能力、配置参数或封装存在差异 | 网关代理层具备人为覆写这些字段的能力 |
| 高 | 8 月 | antml 过滤、Token、截断、大小写无关 | 完全符合 Claude 请求链特征,且经多方复现 | 无法证明是否为官方直连,无法咬定具体型号 |
| 高 | 8 月 | Fork 新会话脱落灰测,原 Session 维持 | 路由状态严格绑定在 Session 会话生命周期上 | 无法识别路由背后的具体业务动机 |
| 高 | 8 月 | 高危安全提问后突变流式并脱落灰测 | 上游熔断后降级回退至 0813 V4 Pro 正式版 | 安全拦截受具体 Prompt 风险等级调节 |
| 中高 | 8 月 | 摘要块式、逐 Token 流式与分词断句 | 存在完全不同的流式推送机制与输出处理路径 | 缺少完整的网络层原始 SSE 数据帧 |
| 中 | 正式版对照 | 空白会话下脏 Token 与免思考无法稳定复现 | 公开正式版并未直接沿用 7 月旧灰测链路 | 上下文被引导后的顺应模仿不构成有效反例 |
| 中 | 8 月 | 2025 年时事知识与冷门政界考题 | 仅能作为收窄模型候选范围的辅助参考 | 受联网检索、RAG 外挂与后训练知识影响极大 |
| 中高 | 跨期对比 | 多个独立技术维度发生系统性断裂 | 7 月与 8 月绝非同一模型链路 | 两轮测试的具体底层版本号均未被直接证明 |
| 中低 | 全周期 | 模型自述、行文文风、标点偏好、猜数字 | 仅作为行为相似性的背景观察 | 易受 Prompt 注入与微调影响,不入核心证据链 |
划定边界不是削弱证据的说服力,而是防止将局部事实过度解读为绝对结论。
antml 规则仅证明流量经过了 Claude 风格的处理管线:第三方中转层或反代兼容层同样有能力人工实现这套规则,不能直接等同于官方直连。本报告基于本地 archive.dht 完整镜像。对社区核心讨论线程(包括 N一串 的 211 条发言及楼主的 237 条核心消息)进行了逐项推演与交叉验证,并补入了测试者 mitu9527 提交的独立 antml 复现日志、生物安全 Fallback 降级记录与原始会话抓包数据。
为保证论证的严肃性与专注度,本页仅精简收录核心证据链相关材料,剥离了非技术性的外部跳转。绝大多数关键实验均留存有完整的录屏及会话原始文件备查。