阿里巴巴发布QwenLong-L1-32B:首个强化学习训练长文本推理大模型,性能直逼Claude-3.7 阿里巴巴近日正式发布全球首个通过强化学习训练的长文本推理模型——QwenLong-L1-32B,专为复杂的长上下文推理与问答场景设计。该模型采用创新的GRPO和DAPO强化学习算法,在长文本推理准确性... 大模型# AI创新# AI推理# AI模型开源 1年前02590