conv.

All stories
AIQuiet 12d · day 13

Researchers identify Matthew Effect bias in LLM reinforcement learning

A new paper shows RL training improves easy problems while hard ones stagnate, proposing Never Give Up as a solution.

What to know

  • RL training of LLMs exhibits a Matthew Effect: gains concentrate on problems the model already solves well, while hard problems remain difficult.
  • The bias appears across math, code, and agentic reasoning tasks, not just in specific domains.
  • Researchers propose Never Give Up as a technique to address this cumulative advantage pattern in reinforcement learning.

Michael Noukhovitch Lead researcherHamish Ivison Co-authorNathan Lambert Co-authorAaron Courville Co-author

How it unfolded 2 developments, newest first · click a bar or a number to jump articlesposts

Peak 2 pieces in 3h at Sep 15, 2 PM; 4 pieces over 13 days (2 articles · 2 posts) Sep 14, 11 PM — 1 piece · 1 article — Newswires 1Sep 15, 2 AM — quietSep 15, 5 AM — quietSep 15, 8 AM — quietSep 15, 11 AM — quietSep 15, 2 PM — 2 pieces · 1 article · 1 post — Hacker News 1, Newswires 1Sep 15, 5 PM — 1 piece · 1 post — Mastodon 1Sep 15, 8 PM — quietSep 15, 11 PM — quietSep 16, 2 AM — quietSep 16, 5 AM — quietSep 16, 8 AM — quietSep 16, 11 AM — quietSep 16, 2 PM — quietSep 16, 5 PM — quietSep 16, 8 PM — quietSep 16, 11 PM — quietSep 17, 2 AM — quietSep 17, 5 AM — quietSep 17, 8 AM — quietSep 17, 11 AM — quietSep 17, 2 PM — quietSep 17, 5 PM — quietSep 17, 8 PM — quietSep 17, 11 PM — quietSep 18, 2 AM — quietSep 18, 5 AM — quietSep 18, 8 AM — quietSep 18, 11 AM — quietSep 18, 2 PM — quietSep 18, 5 PM — quietSep 18, 8 PM — quietSep 18, 11 PM — quietSep 19, 2 AM — quietSep 19, 5 AM — quietSep 19, 8 AM — quietSep 19, 11 AM — quietSep 19, 2 PM — quietSep 19, 5 PM — quietSep 19, 8 PM — quietSep 19, 11 PM — quietSep 20, 2 AM — quietSep 20, 5 AM — quietSep 20, 8 AM — quietSep 20, 11 AM — quietSep 20, 2 PM — quietSep 20, 5 PM — quietSep 20, 8 PM — quietSep 20, 11 PM — quietSep 21, 2 AM — quietSep 21, 5 AM — quietSep 21, 8 AM — quietSep 21, 11 AM — quietSep 21, 2 PM — quietSep 21, 5 PM — quietSep 21, 8 PM — quietSep 21, 11 PM — quietSep 22, 2 AM — quietSep 22, 5 AM — quietSep 22, 8 AM — quietSep 22, 11 AM — quietSep 22, 2 PM — quietSep 22, 5 PM — quietSep 22, 8 PM — quietSep 22, 11 PM — quietSep 23, 2 AM — quietSep 23, 5 AM — quietSep 23, 8 AM — quietSep 23, 11 AM — quietSep 23, 2 PM — quietSep 23, 5 PM — quietSep 23, 8 PM — quietSep 23, 11 PM — quietSep 24, 2 AM — quietSep 24, 5 AM — quietSep 24, 8 AM — quietSep 24, 11 AM — quietSep 24, 2 PM — quietSep 24, 5 PM — quietSep 24, 8 PM — quietSep 24, 11 PM — quietSep 25, 2 AM — quietSep 25, 5 AM — quietSep 25, 8 AM — quietSep 25, 11 AM — quietSep 25, 2 PM — quietSep 25, 5 PM — quietSep 25, 8 PM — quietSep 25, 11 PM — quietYesterday, 2 AM — quietYesterday, 5 AM — quietYesterday, 8 AM — quietYesterday, 11 AM — quietYesterday, 2 PM — quietYesterday, 5 PM — quietYesterday, 8 PM — quietYesterday, 11 PM — quietToday, 2 AM — quietToday, 5 AM — quietToday, 8 AM — quietToday, 11 AM — quietToday, 2 PM — quietToday, 5 PM — quietToday, 8 PM — quiet 12
Sep 15Sep 16Sep 17Sep 18Sep 19Sep 20Sep 21Sep 22Sep 23Sep 24Sep 25yesterdaynow · 11:07 PM ET
  1. 2

    Blog post released explaining Matthew Effect and Never Give Up technique

    Michael Noukhovitch published an interactive blog post accompanying the arxiv paper, breaking down the phenomenon with eval curves from Olmo 3.1 RL-Zero Math training on AIME 2025 questions.

    “The majority of our improvements are coming from the easiest problems going from somewhat solved to mostly solved. The hardest problems are barely improving.”
    — Michael Noukhovitch
  2. 1

    Noukhovitch et al. publish Matthew Effect paper on arXiv

    A research paper titled "Learning to Solve Hard Problems in RL for LLMs by Never Giving Up" was posted to arXiv, introducing the concept of the Matthew Effect in RL for LLMs and proposing a solution method.

    1. first by HN Frontpage, 12d ago · also arXiv cs.AI