<?xml version="1.0" encoding="UTF-8"?>
<urlset xmlns="http://www.sitemaps.org/schemas/sitemap/0.9">
<url>
<loc>https://primeintellect.ai/rl-glossary</loc>
</url>
<url>
<loc>https://primeintellect.ai/rl-glossary/glossary</loc>
</url>
<url>
<loc>https://primeintellect.ai/rl-glossary/introduction</loc>
</url>
<url>
<loc>https://primeintellect.ai/rl-glossary/agents-and-environments</loc>
</url>
<url>
<loc>https://primeintellect.ai/rl-glossary/policies</loc>
</url>
<url>
<loc>https://primeintellect.ai/rl-glossary/harnesses</loc>
</url>
<url>
<loc>https://primeintellect.ai/rl-glossary/tool-calls</loc>
</url>
<url>
<loc>https://primeintellect.ai/rl-glossary/environments</loc>
</url>
<url>
<loc>https://primeintellect.ai/rl-glossary/sandboxes</loc>
</url>
<url>
<loc>https://primeintellect.ai/rl-glossary/environment-scaling</loc>
</url>
<url>
<loc>https://primeintellect.ai/rl-glossary/rollouts-and-traces</loc>
</url>
<url>
<loc>https://primeintellect.ai/rl-glossary/subagents-and-compaction</loc>
</url>
<url>
<loc>https://primeintellect.ai/rl-glossary/self-play</loc>
</url>
<url>
<loc>https://primeintellect.ai/rl-glossary/rewards</loc>
</url>
<url>
<loc>https://primeintellect.ai/rl-glossary/verifiable-rewards</loc>
</url>
<url>
<loc>https://primeintellect.ai/rl-glossary/reward-models-and-judges</loc>
</url>
<url>
<loc>https://primeintellect.ai/rl-glossary/reward-hacking</loc>
</url>
<url>
<loc>https://primeintellect.ai/rl-glossary/evaluation</loc>
</url>
<url>
<loc>https://primeintellect.ai/rl-glossary/advantages</loc>
</url>
<url>
<loc>https://primeintellect.ai/rl-glossary/grpo</loc>
</url>
<url>
<loc>https://primeintellect.ai/rl-glossary/cold-start</loc>
</url>
<url>
<loc>https://primeintellect.ai/rl-glossary/credit-assignment</loc>
</url>
<url>
<loc>https://primeintellect.ai/rl-glossary/policy-gradients</loc>
</url>
<url>
<loc>https://primeintellect.ai/rl-glossary/policy-gradient-loss</loc>
</url>
<url>
<loc>https://primeintellect.ai/rl-glossary/on-policy-and-off-policy</loc>
</url>
<url>
<loc>https://primeintellect.ai/rl-glossary/importance-sampling</loc>
</url>
<url>
<loc>https://primeintellect.ai/rl-glossary/ppo-clipping</loc>
</url>
<url>
<loc>https://primeintellect.ai/rl-glossary/kl-penalty</loc>
</url>
<url>
<loc>https://primeintellect.ai/rl-glossary/entropy-collapse</loc>
</url>
<url>
<loc>https://primeintellect.ai/rl-glossary/rl-algorithms</loc>
</url>
<url>
<loc>https://primeintellect.ai/rl-glossary/rl-scaling</loc>
</url>
<url>
<loc>https://primeintellect.ai/rl-glossary/training-systems</loc>
</url>
<url>
<loc>https://primeintellect.ai/rl-glossary/rollout-generation</loc>
</url>
<url>
<loc>https://primeintellect.ai/rl-glossary/batching-and-packing</loc>
</url>
<url>
<loc>https://primeintellect.ai/rl-glossary/token-level-rendering</loc>
</url>
<url>
<loc>https://primeintellect.ai/rl-glossary/kv-cache</loc>
</url>
<url>
<loc>https://primeintellect.ai/rl-glossary/trainer-inference-mismatch</loc>
</url>
<url>
<loc>https://primeintellect.ai/rl-glossary/async-rl</loc>
</url>
<url>
<loc>https://primeintellect.ai/rl-glossary/weight-broadcast</loc>
</url>
<url>
<loc>https://primeintellect.ai/rl-glossary/scaling-agent-rl</loc>
</url>
<url>
<loc>https://primeintellect.ai/rl-glossary/inference-heavy-workloads</loc>
</url>
<url>
<loc>https://primeintellect.ai/rl-glossary/post-training</loc>
</url>
<url>
<loc>https://primeintellect.ai/rl-glossary/on-policy-distillation</loc>
</url>
<url>
<loc>https://primeintellect.ai/rl-glossary/teacher-sampling</loc>
</url>
<url>
<loc>https://primeintellect.ai/rl-glossary/lora</loc>
</url>
</urlset>
