pjin/super-v3.5-dev-20260826 - #3941
Conversation
Signed-off-by: Jiaqi Zeng <jiaqiz@nvidia.com> Signed-off-by: Peter Jin <pjin@nvidia.com>
Signed-off-by: Peter Jin <pjin@nvidia.com>
Signed-off-by: Peter Jin <pjin@nvidia.com>
Signed-off-by: Peter Jin <pjin@nvidia.com>
Signed-off-by: Peter Jin <pjin@nvidia.com>
…ersion. Signed-off-by: Peter Jin <pjin@nvidia.com>
Signed-off-by: Peter Jin <pjin@nvidia.com>
Signed-off-by: Peter Jin <pjin@nvidia.com>
Signed-off-by: Peter Jin <pjin@nvidia.com>
…in/super-v3.5-dev-20260826 Signed-off-by: Peter Jin <pjin@nvidia.com>
Signed-off-by: Guyue Huang <guyueh@nvidia.com> Signed-off-by: Peter Jin <pjin@nvidia.com>
Signed-off-by: Peter Jin <pjin@nvidia.com>
Signed-off-by: Peter Jin <pjin@nvidia.com>
Signed-off-by: Peter Jin <pjin@nvidia.com>
Signed-off-by: Peter Jin <pjin@nvidia.com>
✅ Submodule Fast-Forward Check ResultsCheck based on commit: 0da8502 (PR #3941 from ✅ Submodules that are properly updated:Gym: ✅ PR branch is ahead of super-v3.5-posttraining branch (fast-forward) All submodule changes look good! ✨ |
vLLM 0.25 can raise a plain ValueError when a chat prompt exceeds the model context. The embedded endpoint surfaced that as HTTP 500, causing NeMo Gym to retry a deterministic request that cannot succeed. Translate only context-length-shaped ValueErrors to HTTP 400 while preserving all typed VLLMValidationError handling and re-raising unrelated ValueErrors. Keep local clamp errors recognizable by Gym and cover each exception path with unit tests. Signed-off-by: Yi-Fu Wu <yifu.wu@gmail.com> Signed-off-by: Peter Jin <pjin@nvidia.com>
✅ Submodule Fast-Forward Check ResultsCheck based on commit: a56840a (PR #3941 from ✅ Submodules that are properly updated:Gym: ✅ PR branch is ahead of super-v3.5-posttraining branch (fast-forward) All submodule changes look good! ✨ |
Signed-off-by: Peter Jin <pjin@nvidia.com>
✅ Submodule Fast-Forward Check ResultsCheck based on commit: 7fb0601 (PR #3941 from ✅ Submodules that are properly updated:Gym: ✅ PR branch is ahead of super-v3.5-posttraining branch (fast-forward) All submodule changes look good! ✨ |
…n; enable by setting `seq_logprob_error_force_on_policy: true`. This skips separate logprob computation, reducing the minimum total step time, but also subtly changes the sequence masking normalization. Signed-off-by: Peter Jin <pjin@nvidia.com>
Represent routed-expert data as logical Ray-backed slices across successive model calls, splice the next prefill route over the prior padded decode route, and preserve the segmented references while flattening training messages. Also pin the Gym correction-turn metadata fix so every call retains its router-replay identity. Signed-off-by: Yi-Fu Wu <yifu.wu@gmail.com> Signed-off-by: Peter Jin <pjin@nvidia.com>
Signed-off-by: Peter Jin <pjin@nvidia.com>
Signed-off-by: Peter Jin <pjin@nvidia.com>
…/?). Signed-off-by: Peter Jin <pjin@nvidia.com>
Signed-off-by: Peter Jin <pjin@nvidia.com>
No description provided.