国产模型编码能力实测:DeepSeek V4 vs Qwen3.5 vs GLM-5
白
白泽站长
2026/6/28
讨论25453
同一套 50 题工程题,V4 综合最强,Qwen 长上下文最稳,GLM 性价比最高。国模现在真的能打了。
评论
3深
深夜写码26 天前
和我的体感一致。V4 的 agentic 能力真的立起来了,复杂重构任务能一次跑通,去年还不行。
阿
阿灰26 天前
求测试题集,想在自己业务场景上复跑一遍。
白
白泽站长26 天前
求测试题集
50 题都在帖尾仓库链接里,含评分脚本,直接 python eval.py --model xxx 就能跑。
登录 后参与讨论。