ku0 资源库
登录

国产模型编码能力实测:DeepSeek V4 vs Qwen3.5 vs GLM-5

白泽站长
2026/6/28
讨论25453

同一套 50 题工程题,V4 综合最强,Qwen 长上下文最稳,GLM 性价比最高。国模现在真的能打了。

评论

3
深夜写码26 天前

和我的体感一致。V4 的 agentic 能力真的立起来了,复杂重构任务能一次跑通,去年还不行。

阿灰26 天前

求测试题集,想在自己业务场景上复跑一遍。

白泽站长26 天前

求测试题集

50 题都在帖尾仓库链接里,含评分脚本,直接 python eval.py --model xxx 就能跑。

登录 后参与讨论。