Skip to content
X · @teortaxesTex · X / Twitter

> And based on the current scores, it hasn't even outperformed GLM-5.1 It’s over …

> And based on the current scores, it hasn't even outperformed GLM-5.1It’s over …karminski-牙医: 刚发的 DeepSeek-V4-Pro-0813 好像的确有问题, reasoning_effort=max 的时候模型在长程 AgenticCoding 任务下更倾向于早停. 我这个测试总计50轮, 让模型不断优化代码, 结果他在3次测试中, 2次都在42-43轮左右的情况下停止了. 并未用完全部机会. 而且目前成绩来看, 甚至没打过 GLM-5.1