在单张4090上跑起来125B的Qwen Next,用deepseek harness试了个任务,流畅程度让我一度怀疑是不是选错模型到在线api服务了,检查了一下账单没有扣费才确信应该是没错。即使上下文窗口只有128K,也足够跑绝大多数日常任务,这还是接近无损的Q3,Q2上下文可以开到256K。感觉4090及以下的显卡和32G的RAM即
在单张4090上跑起来125B的Qwen Next,用deepseek harness试了个任务,流畅程度让我一度怀疑是不是选错模型到在线api服务了,检查了一下账单没有扣费才确信应该是没错。即使上下文窗口只有128K,也足够跑绝大多数日常任务,这还是接近无损的Q3,Q2上下文可以开到256K。感觉4090及以下的显卡和32G的RAM即