咸鱼诈尸了
最近,Qwen3.8-27B在国内外的AI社区中引起了不小的反响,从官方公布的benchmark上来看,在编码能力上,它已经能和当年的Claude Opus4.6打得有来有回,甚至在某些场景下略有领先。在deepseek宣布涨价的背景下,这样一款可以在本地部署的编码模型确实让人眼前一亮。官方跑分数据如下:

以下是本次测试所使用的配置文件,在编程场景中,平均速度为40+token/s,且均使用官方推荐设置:
services:
Qwen3.8-27B-AWQ-INT4:
container_name: Qwen3.8-27B-AWQ-INT4
image: vllm/vllm-openai:v0.27.1
restart: always
ports:
- "8000:8000"
shm_size: "16g"
ipc: host
command: [
"/data/MODELS/Qwen3.8-27B-AWQ-INT4",
"--max-model-len", "200000",
"--max-num-seqs", "16",
"--gpu-memory-utilization", "0.80",
"--kv-cache-dtype", "fp8",
"--max-num-batched-tokens", "16384",
"--enable-chunked-prefill",
"--speculative-config", '{"method":"qwen3_next_mtp","num_speculative_tokens":4}',
"--compilation-config", '{"mode": 3, "compile_ranges_endpoints": [16384], "max_cudagraph_capture_size": 32, "cudagraph_capture_sizes": [1, 2, 4, 8, 16, 32]}',
"--enable-auto-tool-choice",
"--tool-call-parser", "qwen3_xml",
"--reasoning-parser", "qwen3",
"--served-model-name", "qwen38-27b-int4",
"--enable-prefix-caching",
"--host", "0.0.0.0",
"--port", "8000",
"--tensor-parallel-size", "2",
"--trust-remote-code"
]
volumes:
- ./Qwen3.8-27B-AWQ-INT4:/data/MODELS/Qwen3.8-27B-AWQ-INT4
- ./vllm_cache/Qwen3.8-27B-AWQ-INT4/torch:/root/.cache/torch
- ./vllm_cache/Qwen3.8-27B-AWQ-INT4/triton:/root/.triton
- ./vllm_cache/Qwen3.8-27B-AWQ-INT4/vllm:/root/.cache/vllm
environment:
- TZ=Asia/Shanghai
- VLLM_LOGGING_LEVEL=DEBUG
- VLLM_API_KEY=12345
- PYTHONFAULTHANDLER=1
- TORCH_SHOW_CPP_STACKTRACES=1
- TORCH_DISABLE_ADDR2LINE=1
- TORCH_CPP_LOG_LEVEL=INFO
- NCCL_DEBUG=WARN
- VLLM_USE_V1=1
- VLLM_SLEEP_WHEN_IDLE=1
- VLLM_USE_FLASHINFER_SAMPLER=1
- OMP_NUM_THREADS=4
- PYTORCH_CUDA_ALLOC_CONF=expandable_segments:True
- TORCH_CUDA_ARCH_LIST="8.9"
- SAFETENSORS_FAST_GPU=1
- CUDA_DEVICE_ORDER=PCI_BUS_ID
ulimits:
memlock: -1
stack: 67108864
deploy:
resources:
reservations:
devices:
- driver: nvidia
device_ids: ["0", "1"]
capabilities: [gpu]
runtime: nvidiadebug测试
首先是debug测试,我让Qwen3.8-27B 修改我的typesense插件中的一个分段问题,bug产生的原因是文章内容中含有emoj表情,在一些特定情况下,截断会产生非法字符。在opencode的环境下,Qwen3.8-27B 大约花费25分钟完成。作为对比,GPT5.6-sol-high大约花费10分钟。
长任务coding测试 1
为了测试Qwen3.8-27B 在harness中的编程表现,我让它完成一个html版本的经典坦克大战,为了增加难度以及看看它在长时任务中的表现,我要求它一次性设计6个关卡,同时还要有掉落道具,多血条敌人,多类型墙砖等额外要素,测试环境为opencode+superpowers。
Qwen3.8-27B 共计花费约2小时完成下面的版本:

上手后未发现明显bug,道具掉落,敌人生成,通关条件等皆符合预期。Qwen3.8-27B 最让我惊喜的是,在只设置了200K上下文的情况下,经历了上下文压缩后,它依然能遵循superpowers中的循环流程。这一点甚至要好于GPT5.4。
长任务coding测试 2
我又让Qwen3.8-27B完成一个命令行应用:一个能够自定义opencode的subagent工具,测试环境为opencode+superpowers。
这一次大约跑了8个小时,cc统计大概使用了5千万的token:(VLLM没有返回缓存统计,请无视缓存命中率)

看起来还挺像那么回事:



不过还是出现了一个致命的bug,就是完全没有解析出jsonc中的模型,怀疑是在TDD过程中根本没有使用真实的jsonc数据,而是自己编造了一份。不过可能是由于现在目前AI似乎都尽可能回避敏感信息的缘故,我没有提供一份示例所导致的。不过其它功能都很正常,我编造了一个模型名称后,opencode顺利找到了新的subagent。
总结
Qwen3.8-27B 确实是一个很强的本地模型,但是xhigh思考强度下思考时间确实过长(一个符号失误竟然花了近1万token找原因),等后续看看社区是否有thinkcap版本。
Qwen3.8-27B 测试(1)
https://556799.xyz/archives/qwen3.8-27b-ce-shi-1
Comments