LLM の強化学習は、モデルの出力に点数(報酬)を付け、点数の高い出力を出しやすくなるようにモデルを更新する訓練である。訓練の仕組みは GRPO の記事で説明した。2025 年以降は、コード補完、病名コードの付与、法律文書の分析といった企業の製品や業務でも、この訓練を使った例が公表されている。
活用の 3 つの型
公表されている例は、誰がモデルを訓練するかで 3 つに分かれる。
| 型 | 訓練する主体 | 例 |
|---|---|---|
| 自社の製品に載せるモデルを訓練する | 製品を作る企業 | Cursor のコード補完、Cognition のコーディング用エージェント |
| API で提供される訓練機能を使う | モデルを利用する企業 | OpenAI、Fireworks AI、AWS、Microsoft が提供する機能の利用企業 |
| 汎用のモデルそのものを訓練する | モデルを開発する企業 | DeepSeek-R1、Kimi K2 |
3 つ目の型は、GRPO の記事の「報酬の設計」の節で DeepSeek-R1 を例に説明した。Kimi K2 も、プログラムで正誤を確かめられる報酬と、モデル自身が採点基準に沿って採点する報酬を組み合わせて訓練されている。以下では、前の 2 つの型を扱う。
以下の数値は、断りがない限り、各社が自社の文書で発表したものである。第三者が確かめた値ではない。
利用者の反応を報酬にする例
Cursor は、コードエディタの補完機能(Tab)のモデルを、利用者の反応を使って訓練している。Tab は利用者が文字を打つたびに次の編集を予測し、1 日に 4 億回以上の要求を処理する。利用者が提案を採用したか、却下したかが、そのまま報酬になる。
Cursor が例として挙げた報酬は次のとおりである。
| モデルの行動と利用者の反応 | 報酬 |
|---|---|
| 提案を表示し、採用された | +0.75 |
| 提案を表示し、却下された | −0.25 |
| 提案を表示しなかった | 0 |
採用される確率を とすると、提案を表示したときの報酬の期待値は である。この値が正になるのは のときだけなので、モデルは「採用される見込みが 25% を超えるときだけ表示する」ことを学ぶ。採用されそうにない提案を出さないことを、報酬の数値で指定している。
図は、以前のモデルを基準にした相対的な変化を表す。新しいモデルは、提案を表示する回数が 21% 減り、表示した提案が採用される割合が 28% 上がった。
この訓練には、いま使われているモデルが出した提案への反応が必要になる。更新の方向を、更新するモデル自身の出力とその報酬から計算するためである。そのため Cursor は、新しいモデルを利用者に配り、反応を集めて次の更新に使う、という 1 周を繰り返す。この 1 周に 1.5 時間から 2 時間かかる。
作業環境の中で訓練する例
コーディング用のエージェントは、ファイルの検索、編集、コマンドの実行といったツールを何度も使って作業を進める。Cursor と Cognition は、作業環境を大量に用意し、その中でモデルに課題を解かせて訓練している。
| 企業 | モデル | 訓練の内容 |
|---|---|---|
| Cursor | Composer | 製品と同じツールを使える環境で、ソフトウェア開発の課題を解かせる。数十万の隔離された環境を同時に動かす |
| Cognition | SWE-1.5 | 公開されているモデルをもとに、自社のエージェントの仕組みの上で、実際の課題の環境を使って強化学習を行う |
Cursor は、Composer の生成速度が同程度の性能のモデルの 4 倍だと発表している。訓練の中で、モデルは複雑な検索、リンターのエラーの修正、テストの作成と実行を自分で行うようになったという。
Cognition は、採点の方法を 3 つ挙げている。
- テスト(ユニットテスト、結合テスト)で、正しく動くかを確かめる。
- 採点基準で、コードの品質と進め方を評価する。
- ブラウザを操作するエージェントで、機能が最後まで動くかを確かめる。
採点の穴を突かれないように、人間の専門家が採点をすり抜ける方法を探して穴をふさぐ作業も行っている。Cognition はこれを reward hardening と呼ぶ。この作業を重ねると、従来のテストに多くの穴が見つかったと報告している。後継の SWE-1.6 は、同じ事前学習済みモデルから訓練し直したもので、SWE-Bench Pro の点数が SWE-1.5 より 11% 高い。
API で自社の課題に合わせる例
OpenAI、Fireworks AI、AWS、Microsoft は、利用する企業が自社の課題でモデルを強化学習できる機能を提供している。この機能は強化学習ファインチューニング(RFT)と呼ばれる。利用する企業が用意するのは、課題のデータと、出力に点数を付ける評価関数(GRPO の記事の報酬関数にあたる)である。
図は Fireworks AI の機能の流れである。何度もやり取りをするエージェントの訓練では、1 と 2 を数百回繰り返す。
OpenAI が自社の文書で紹介している利用例は次のとおりである。
| 企業 | 課題 | 評価関数 | 発表された結果 |
|---|---|---|---|
| Ambience Healthcare | 診察の内容に病名コード(ICD-10)を付ける | 記載なし | もとのモデル 0.39、医師 0.45、訓練後 0.57 |
| Harvey | 法律文書から、主張の根拠になる箇所を抜き出す | 抜き出した箇所の適合率と再現率(F1) | F1 が 0.563 から 0.6765 に上昇 |
| Accordance | 税務の分析 | 専門家が作った採点基準。項目ごとに部分点を与える | もとのモデルから 38.89% 改善 |
| SafetyKit | 投稿内容が規約に違反するかの判定 | 記載なし | F1 が 86% から 90% に上昇 |
| Milo | 家族の予定の登録、重複と衝突の検出 | 登録内容が完全か、分類が正しいか、重複や衝突を検出したか | 平均が 0.86 から 0.91、最も難しい場面が 0.46 から 0.71 に上昇 |
| Runloop | 決済サービスの API を使うコードの生成 | 出力の形式と、コードの構文を解析した結果 | もとのモデルから平均 12% 改善 |
| ChipStack | 半導体の検証用部品の配線 | 正解の対応表との一致 | 50 件未満のデータで訓練 |
ほかの提供元が発表している例は次のとおりである。
| 提供元 | 企業 | 課題 | 発表された結果 |
|---|---|---|---|
| Fireworks AI | Genspark | 調査を行うエージェント | 比較したモデルより品質が 10% 高く、ツールの呼び出しが 33% 増え、費用が約 50% 減った |
| Fireworks AI | Vercel | コード生成 | エラーのない生成が 93%。比較したモデルより 33% 改善 |
| AWS | Salesforce | 自社の業務の課題 | もとのモデルから最大 73% 改善(AWS による測定) |
| Microsoft | DraftWise | 契約書の作成と確認 | 検索結果の品質が 30% 改善 |
AWS は、この機能によって、もとのモデルより精度が平均 66% 上がると発表している。
評価関数が公開されている例は、正解との一致やコードの解析といった、プログラムで確かめられる方法を使っている。Accordance の例は、専門家の採点基準を項目に分け、項目ごとに部分点を与える形にしている。
医療での例
医療で企業が公表している例は、前の節の Ambience Healthcare である。OpenAI の文書によると、数百件の診察を集めた評価用のデータで、訓練前のモデルは医師の点数を 6 ポイント下回っていたが、訓練後は 12 ポイント上回った。病名コードは約 7 万種類あり、誤ると監査や罰金につながる、と文書は説明している。
研究では、教師あり学習(SFT)のあとに GRPO を足す二段階の訓練が報告されている。
| 研究 | 課題 | 結果 |
|---|---|---|
| 放射線レポートの研究(Wei ら、2026) | 放射線レポートから病名を分類する | 教師あり学習に GRPO を足すと、3 つのモデルと 3 つのデータの組み合わせ 9 通りのうち、8 通りで分類の精度がさらに上がった |
| 病名コードの研究(Wang ら、2026) | 退院時の記録に病名コードを付ける | 主な向上は教師あり学習によるもので、GRPO はそこからさらに改善した |
放射線レポートの研究では、放射線科医 2 人が、2 つのモデルの推論の説明を 50 件ずつ見比べた。1 人目は、GRPO を足したモデルを 30 件、教師あり学習だけのモデルを 17 件で選んだ。2 人目は 18 件と 11 件だった。
どちらの研究も、GRPO だけで訓練するのではなく、教師あり学習で基礎を作ってから GRPO で上積みしている。
ハルシネーションを抑える報酬
モデルが事実と違う内容を答えることを、ハルシネーションと呼ぶ。TruthRL(Wei ら、2025。バージニア大学と Meta などの研究者による論文)は、報酬の付け方を変えるとハルシネーションが減ると報告した。
正解かどうかだけで報酬を決めると、「分からない」と答えた場合と、誤った答えを出した場合の報酬が同じになる。答えれば正解する可能性がある分だけ、当て推量でも答えたほうが報酬の期待値は高い。論文は、この報酬のもとではモデルがつねに答えようとし、ハルシネーションが増えると指摘する。そこで TruthRL は、報酬を 3 通りに分ける。
| 回答 | 正誤だけの報酬 | TruthRL の報酬 |
|---|---|---|
| 正しい | +1 | +1 |
| 「分からない」と答える | −1 | 0 |
| 誤っている | −1 | −1 |
訓練には GRPO を使う。論文の要旨は、4 つの評価用データでの実験の例として、ハルシネーションの割合が 43.5% から 19.4% に下がったことを挙げている。
この報酬と Cursor の補完の報酬は、数値は違うが、出力を控えると 0、出力して外れると負になる点が共通している。この形にすると、当たる見込みが低いときは出力を控えたほうが報酬の期待値が高くなる。
効果が小さかった報告
「強化学習を使えば教師あり学習より良くなる」とは限らない。Dialpad は、ツールを呼び出すエージェントの訓練で、教師あり学習(LoRA)、GRPO、両者の組み合わせを比べた。対象は 0.6B から 32B までの 6 つのモデルである。
- 訓練と同じ種類のデータで評価すると、18 の条件のうち 15 で教師あり学習が最も高かった。
- 訓練と違うデータで評価すると、54 の条件のうち 29 で GRPO が最も高かった。ただし教師あり学習との差は、平均で 1 ポイント未満だった。
- 教師あり学習のあとに GRPO を足しても、安定した上積みは得られなかった。
ツールの呼び出しは、正しい呼び出しの例を用意できる課題である。この比較の範囲では、そうした課題は教師あり学習で足りた。
数値を読むときの注意
- この記事の数値の大半は、機能を提供する企業か、その利用企業が発表したものである。
- 比較の相手が例ごとに違う。もとのモデルとの比較、ほかのモデルとの比較、人間との比較が混ざっている。
- 「改善」の単位も違う。ポイントの差、割合、F1 が混ざっているので、例どうしを数値で比べることはできない。
- 国内の企業の例は、調べた範囲では見つからなかった。
出所
- Cursor, Improving Cursor Tab with online RL(2025): 補完の報酬と結果
- Cursor, Composer: Building a fast frontier model with RL(2025): コーディング用エージェントの訓練
- Cognition, Introducing SWE-1.5: Our Fast Agent Model(2025): 採点の方法、採点の穴をふさぐ作業
- Cognition, An Early Preview of SWE-1.6 and Research Update(2026): SWE-1.6 の結果
- OpenAI, Reinforcement fine-tuning use cases: API の利用例と評価関数
- Fireworks AI, Fireworks RFT(2025): 訓練の流れ、Genspark と Vercel の例
- AWS, Amazon Bedrock now supports reinforcement fine-tuning(2025): 平均の改善幅
- Amazon, AWS simplifies model customization(2025): Salesforce の例
- Microsoft, Fine-Tuning Together(2025): DraftWise の例
- Wei ら(Zhepei Wei ほか), TruthRL: Incentivizing Truthful LLMs via Reinforcement Learning(2025): 3 通りの報酬
- Wei ら(Yishu Wei ほか), Reinforcement Learning Improves LLM Accuracy and Reasoning in Disease Classification from Radiology Reports(2026): 放射線レポートの分類
- Wang ら, Can Post-Training Turn LLMs into Good Medical Coders?(2026): 病名コードの付与
- Dialpad, SFT or RL for Tool-Calling Agents?(2026): 教師あり学習との比較
- DeepSeek-AI, DeepSeek-R1(2025)、Moonshot AI, Kimi K2(2025): 汎用のモデルの訓練