DeepSeek V3.1 vs V4 PRO

24点游戏解法去重 · 大模型对比分析报告

● V3.1 (671B Cloud) ● V4 PRO

核心指标概览
1,820
题目总数
1,362
有解题数
458
无解题数
1,358
V4 已完成去重
99.7%

🟣 DeepSeek V3.1 (671B Cloud)

去重记录数 1,820
有解记录 1,362
去重后平均解法数 2.77
去重后解法范围 1 ~ 61
去重失败(未去除任何解法) 1 题
已标记最佳解法 1,311 / 1,362
完整覆盖 1820 题 已完成最佳标记

🟡 DeepSeek V4 PRO

去重记录数 1,358
有解记录 1,358
去重后平均解法数 2.79
去重后解法范围 1 ~ 124
去重失败(未去除任何解法) 17 题
已标记最佳解法 0 / 1,358
99.7% 完成度 存在去重失败 待标记最佳
去重效果对比

📊 去重保留率分布

⚖️ 两模型结果差异分布

📈 按原始解法数量分桶对比

🔢 去重后解法数量分布

🎯 两模型去重结果一致率

74.4%
去重后解法数完全一致 (1,010 / 1,358)
V3.1 保留更多解法 200 题 (14.7%)
V4 PRO 保留更多解法 148 题 (10.9%)
完全一致 1,010 题 (74.4%)

两模型一致题目的去重后解法数分布

去重后解法数题目数量占比累计占比
137036.6%36.6%
234334.0%70.6%
317016.8%87.4%
4888.7%96.1%
5242.4%98.5%
690.9%99.4%
7+60.6%100%
差异最大的题目 TOP 20

⚠️ 两模型去重后解法数差异最大(原始解法 > 20)

ID数字组合原始解法数 V3.1 去重后V3.1 保留率 V4 去重后V4 保留率 差异 (V3.1−V4)
862(3,3,7,11)124 32.4% 124100.0% −121
595(2,3,11,12)90 11.1% 90100.0% −89
1676(7,10,10,11)90 33.3% 90100.0% −87
1270(4,8,8,8)72 34.2% 72100.0% −69
236(1,4,4,4)60 23.3% 60100.0% −58
517(2,2,8,12)236 5623.7% 62.5% +50
1189(4,5,8,12)48 612.5% 48100.0% −42
1056(3,8,9,9)276 3412.3% 41.4% +30
1103(3,12,12,13)32 2681.3% 13.1% +25
1393(5,6,9,10)32 2475.0% 26.3% +22
1070(3,8,13,13)276 238.3% 20.7% +21
545(2,3,4,4)130 2317.7% 32.3% +20
953(3,5,6,9)54 2546.3% 713.0% +18
818(2,12,13,13)276 207.2% 41.4% +16
1434(5,7,13,13)90 11.1% 1516.7% −14
671(2,5,6,13)24 1354.2% 28.3% +11
481(2,2,4,6)364 164.4% 61.6% +10
127(1,2,5,7)70 1318.6% 34.3% +10
30(1,1,3,7)128 129.4% 21.6% +10
20(1,1,2,8)120 10.8% 108.3% −9
V4 PRO 去重异常分析

🚨 V4 PRO 去重失败题目(保留率 = 100%,未去除任何解法)

关键发现

  • V4 PRO 共有 17 题去重失败(保留率 = 100%),而 V3.1 仅有 1 题去重失败
  • 失败主要集中在 高解法数题目:124、90、72、60 等解法的大题目,可能是模型输出超长被截断,直接返回了原始解法
  • 部分小解法数题目(4~8 个)也存在失败,说明 V4 在处理少量解法时偶有"不执行去重"的情况
ID数字组合原始解法数V4 去重后状态
862(3,3,7,11)124124去重失败
1676(7,10,10,11)9090去重失败
595(2,3,11,12)9090去重失败
1270(4,8,8,8)7272去重失败
236(1,4,4,4)6060去重失败
1189(4,5,8,12)4848去重失败
819(2,13,13,13)1212去重失败
1226(4,6,8,13)88去重失败
1666(7,9,10,11)88去重失败
42(1,1,4,9)88去重失败
331(1,5,11,12)88去重失败
1076(3,9,10,10)44去重失败
1350(5,5,8,8)44去重失败
296(1,5,5,10)44去重失败
429(1,9,10,13)44去重失败
432(1,9,11,13)44去重失败
247(1,4,5,6)22去重失败
综合分析与结论

🟣 DeepSeek V3.1 优势

  • 去重稳定性极佳:1,820 题全部完成,仅 1 题去重失败,失败率 0.07%
  • 已完成最佳标记:1,311 / 1,362 题已标记最佳解法(96.3%),用户可直接使用
  • 大解法数题目表现好:在原始解法数 ≥ 21 的题目中,去重保留率合理(8.8%~30.9%)
  • 去重一致性高:与 V4 结果一致率达 74.4%,说明核心去重逻辑可靠

🟡 DeepSeek V4 PRO 优势

  • 极端去重能力强:对部分题目(如 3,8,9,9)能做到从 276 解法压缩到 4 个,激进但有效
  • 低解法数题目保留更多:1~5 解法题目平均保留 1.19 个(V3.1 为 1.05 个),可能保留更多"边缘不同"解法
  • 推理能力可能更强:V4 作为更新模型,在理解运算律等价性方面有更深层的分析能力

V4 PRO 存在的问题

问题一:去重失败率偏高(17 / 1,358 = 1.25%)

  • 17 题完全未执行去重,保留率 = 100%,其中包含 6 题原始解法数 ≥ 8 的大题
  • 疑似原因:模型输出被 max_tokens=4096 截断,大解法数题目的去重结果无法完整输出
  • V3.1 的同题去重结果显示这些题完全可以被正常去重(如 862 题 V3.1 从 124→3)

问题二:去重过于激进

  • 部分题目 V4 去重后仅保留 1~2 个解法,但 V3.1 保留 20+ 个
  • 例如 1103 题 (3,12,12,13):V3.1 保留 26 个解法(81.3%),V4 仅保留 1 个(3.1%)
  • 过于激进去重可能导致 本质不同的解法被误判为等价而丢失

问题三:尚未完成最佳标记

  • V4 的 best_deduplicated_solution 全部为 0,用户无法直接使用其结果选择最佳解法

🏆 综合评价

评估维度 DeepSeek V3.1 DeepSeek V4 PRO 胜出
任务完成度 1,820 / 1,820 (100%) 1,358 / 1,362 (99.7%) V3.1
去重稳定性 1 题失败 (0.07%) 17 题失败 (1.25%) V3.1
去重合理度 保留率适中 部分过于激进 V3.1
极端去重能力 标准去重 更深层次去重 V4
最佳标记 1,311 / 1,362 (96.3%) 0 / 1,358 (0%) V3.1
平均去重保留率 10.0% 10.0% 持平

💡 建议

  1. 修复 V4 去重失败问题:对 17 题去重失败记录重新调用 API,考虑增大 max_tokens 至 8192 或 16384
  2. 补全 V4 剩余 4 题:完成最后 4 题的去重,达到 100% 覆盖
  3. 开展最佳标记:对 V4 结果进行 best_deduplicated_solution 标记,供前端展示使用
  4. 交叉验证:对两模型差异较大的题目(|diff| ≥ 10),人工核实哪个模型的去重更合理
  5. 生产环境仍以 V3.1 为准:V3.1 去重更稳定、已标记最佳、覆盖完整,建议继续作为主模型
  6. V4 作为辅助参考:V4 的激进去重策略可作为"深度去重"选项,由用户自行选择