跳到正文
热点事件持续更新

Qwen3.8 27B 本地模型加法基准测试:禁用推理性能骤降

1 篇报道1 个报道来源19 小时前更新

先了解这件事

AI 综述

2026年10月5日,Simon Willison发布基准测试报告,评估Qwen3.8-27B-Q4_K_M.gguf模型将正整数加法运算转换为英文单词描述的能力。测试结果显示,当禁用思维链(CoT)推理功能时,模型总准确率仅为23.57%;尤其在大位数问题上表现严重下滑,从两位数至十三位数区间的正确率由97.04%暴跌至6.44%。然而,在启用推理功能后,模型表现显著改善,在169个配对案例中正确回答了167次,验证了推理机制对该类任务的关键作用。

AI 根据报道生成 · 2 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月5日
  1. Simon Willison
    Qwen3.8 27B 加法基准测试:禁用推理性能骤降,启用后几乎全对

    Qwen3.8-27B-Q4_K_M.gguf 模型在正整数加法转英文单词基准测试中,禁用推理时总准确率仅 23.57%,两位数至十三位数正确率从 97.04% 暴跌至 6.44%。启用推理后,模型在 169 个配对案例中正确回答 167 次。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。