原标题:《Qwen 3.8 27B available on Cerebras at 1500 tok/SEC》 评分: 633 | 作者: altertable 💭 1500 tok/s,最后卖的其实是限流吧? 🎯 讨论背景 Cerebras(做 wafer-scale AI 芯片和推理云的公司)这次把 Qwen 3.8 27B(阿里系开源模型家族的 27B 版本)放到公开 API 上,主打约 1500 tok/s 的超高输出速度。讨论很快转向实际可用性:很多人发现这条公共线路有 128k context 上限、账号级 TPM 限流,以及 prompt caching 但不降价。由于 coding agent 往往会反复把代码、文档和工具调用塞回上下文,单次请求快并不等于整段任务更快。评论还把它和 OpenRouter(模型 API 聚合平台)、DeepSeek-V4-Flash(主打低成本/高吞吐的推理模型)以及本地推理栈如 ninfer、vLLM、LM Studio 做了比较,争论到底是该为极致速度付费,还是直接自托管。 📌 讨论焦点 高吞吐被账号级限流抵消 很多评论认为,