咸鱼诈尸了

最近,Qwen3.8-27B在国内外的AI社区中引起了不小的反响,从官方公布的benchmark上来看,在编码能力上,它已经能和当年的Claude Opus4.6打得有来有回,甚至在某些场景下略有领先。在deepseek宣布涨价的背景下,这样一款可以在本地部署的编码模型确实让人眼前一亮。官方跑分数据如下:

以下是本次测试所使用的配置文件,在编程场景中,平均速度为40+token/s,且均使用官方推荐设置:

services:
  Qwen3.8-27B-AWQ-INT4:
    container_name: Qwen3.8-27B-AWQ-INT4
    image: vllm/vllm-openai:v0.27.1
    restart: always
    ports:
      - "8000:8000"
    shm_size: "16g"
    ipc: host
    command: [
      "/data/MODELS/Qwen3.8-27B-AWQ-INT4",
      "--max-model-len", "200000",
      "--max-num-seqs", "16",
      "--gpu-memory-utilization", "0.80",
      "--kv-cache-dtype", "fp8",
      "--max-num-batched-tokens", "16384",
      "--enable-chunked-prefill",
      "--speculative-config", '{"method":"qwen3_next_mtp","num_speculative_tokens":4}',
      "--compilation-config", '{"mode": 3, "compile_ranges_endpoints": [16384], "max_cudagraph_capture_size": 32, "cudagraph_capture_sizes": [1, 2, 4, 8, 16, 32]}',
      "--enable-auto-tool-choice",
      "--tool-call-parser", "qwen3_xml",
      "--reasoning-parser", "qwen3",
      "--served-model-name", "qwen38-27b-int4",
      "--enable-prefix-caching",
      "--host", "0.0.0.0",
      "--port", "8000",
      "--tensor-parallel-size", "2",
      "--trust-remote-code"
    ]
    volumes:
      - ./Qwen3.8-27B-AWQ-INT4:/data/MODELS/Qwen3.8-27B-AWQ-INT4
      - ./vllm_cache/Qwen3.8-27B-AWQ-INT4/torch:/root/.cache/torch
      - ./vllm_cache/Qwen3.8-27B-AWQ-INT4/triton:/root/.triton
      - ./vllm_cache/Qwen3.8-27B-AWQ-INT4/vllm:/root/.cache/vllm
    environment:
      - TZ=Asia/Shanghai
      - VLLM_LOGGING_LEVEL=DEBUG
      - VLLM_API_KEY=12345
      - PYTHONFAULTHANDLER=1
      - TORCH_SHOW_CPP_STACKTRACES=1
      - TORCH_DISABLE_ADDR2LINE=1
      - TORCH_CPP_LOG_LEVEL=INFO
      - NCCL_DEBUG=WARN
      - VLLM_USE_V1=1
      - VLLM_SLEEP_WHEN_IDLE=1
      - VLLM_USE_FLASHINFER_SAMPLER=1
      - OMP_NUM_THREADS=4
      - PYTORCH_CUDA_ALLOC_CONF=expandable_segments:True
      - TORCH_CUDA_ARCH_LIST="8.9"
      - SAFETENSORS_FAST_GPU=1
      - CUDA_DEVICE_ORDER=PCI_BUS_ID
    ulimits:
      memlock: -1
      stack: 67108864
    deploy:
      resources:
        reservations:
          devices:
            - driver: nvidia
              device_ids: ["0", "1"]
              capabilities: [gpu]
    runtime: nvidia

debug测试

首先是debug测试,我让Qwen3.8-27B 修改我的typesense插件中的一个分段问题,bug产生的原因是文章内容中含有emoj表情,在一些特定情况下,截断会产生非法字符。在opencode的环境下,Qwen3.8-27B 大约花费25分钟完成。作为对比,GPT5.6-sol-high大约花费10分钟。

长任务coding测试 1

为了测试Qwen3.8-27B 在harness中的编程表现,我让它完成一个html版本的经典坦克大战,为了增加难度以及看看它在长时任务中的表现,我要求它一次性设计6个关卡,同时还要有掉落道具,多血条敌人,多类型墙砖等额外要素,测试环境为opencode+superpowers。

Qwen3.8-27B 共计花费约2小时完成下面的版本:

上手后未发现明显bug,道具掉落,敌人生成,通关条件等皆符合预期。Qwen3.8-27B 最让我惊喜的是,在只设置了200K上下文的情况下,经历了上下文压缩后,它依然能遵循superpowers中的循环流程。这一点甚至要好于GPT5.4。

长任务coding测试 2

我又让Qwen3.8-27B完成一个命令行应用:一个能够自定义opencode的subagent工具,测试环境为opencode+superpowers。

这一次大约跑了8个小时,cc统计大概使用了5千万的token:(VLLM没有返回缓存统计,请无视缓存命中率)

看起来还挺像那么回事:

不过还是出现了一个致命的bug,就是完全没有解析出jsonc中的模型,怀疑是在TDD过程中根本没有使用真实的jsonc数据,而是自己编造了一份。不过可能是由于现在目前AI似乎都尽可能回避敏感信息的缘故,我没有提供一份示例所导致的。不过其它功能都很正常,我编造了一个模型名称后,opencode顺利找到了新的subagent。

总结

Qwen3.8-27B 确实是一个很强的本地模型,但是xhigh思考强度下思考时间确实过长(一个符号失误竟然花了近1万token找原因),等后续看看社区是否有thinkcap版本。