# Dirl Diffusion Rl

> Enable effective RL for diffusion language models via DiPO (unbiased GRPO for dLLMs) and framework optimizations. FlexAttention accelerates blockwise training, LMDeploy optimizes inference, achieving training-inference consistency—improving dLLM math performance to rival larger autoregressive models.

- Skill: `adu2021/dirl-diffusion-rl` (Agent Skill)
- Install (CLI): `npx skillmds@latest add adu2021/dirl-diffusion-rl`
- Raw SKILL.md: https://api.skillmd.com/api/skills/adu2021/dirl-diffusion-rl/raw
- Safety review: pending
- Works with: Claude Code, Claude.ai, OpenAI Codex
- Category: AI & ML
- License: MIT
- Author: adu2021 (https://skillmd.com/u/adu2021)
- Updated: 2026-09-17
- Page: https://skillmd.com/skills/adu2021/dirl-diffusion-rl

---


## Overview

DiRL introduces RL infrastructure tailored for diffusion language models.

## Core Technique

**DiPO Algorithm:**
First unbiased Group Relative Policy Optimization for dLLMs.

```python
def dipo_training(model, dataset):
    # Blockwise attention for efficient computation
    # Unbiased logit computation (fixes prior biases)
    # GRPO with dLLM-specific optimizations
```

## Performance

- State-of-the-art dLLM math performance
- Outperforms larger autoregressive models

## References

- DiPO: unbiased GRPO for dLLMs
- Blockwise training optimization

