Jinn's Hub
about / blog / sources / projects / EN /
所有标签

标签: "RL"

    长序列 MoE RL 训练:从第一性原理到 MI300X
    从第一性原理重新推导 Yan Bai 的长序列 MoE RL 优化(Path B 重计算、 linear cross-entropy、 FSDP2、 chunked expert-parallel overlap), 以及它们在 AMD MI300X / MI355X 上各自意味着什么。
    NeMo-RL vs slime:RL 训练框架对比
    两个主流 RL 训练框架的深度对比:算法、工程质量、MoE 支持、ROCm 兼容性
    TritonForge:面向多轮 Agent 任务的 Server-based RL 训练与评测闭环
    基于 slime + Megatron 的端到端 Server-based RL 框架,聚焦 Triton 内核生成,支持 NVIDIA 与 AMD 双生态
    SFT 与 RL 训练指南
    SFT 和 RL 的核心区别、Loss 计算、数据构建到 RLHF 实战的完整指南
© 2026 • Jinn's Hub 🔬
Press Esc or click anywhere to close