0 旧サイトリンク
Paper Summary
1 AIが学習する仕組み
1.1 RLHF : 人間の評価をもとにした強化学習
InstructGPT_Alignment_and_RLHF.pdf
1.2 Verify Step By Step : 導出過程を全て評価し、部分点を与える
Verify_Step_By_Step.pdf
2 AIエージェントが賢い理由
1.1 Chain of Thought : 考えてから答える
Chain_of_Thought_LLM_Reasoning.pdf
1.2 Tree of Thought : 複数の選択肢を考慮して答える
Tree_of_Thoughts_LLM_Deliberation.pdf
1.3 ReAct : 考えながら行動をアップデートする
ReAct_Reasoning_and_Acting_Agents.pdf
1.4 Toolformer : AI電卓などのツールを使って回答する
Toolformer_LLMs_Teach_Themselves_Tools.pdf
3 賢いAIが安く早く使えるようになった理由
3.1 Speculative Sampling : 次の言葉を軽量モデルで先回りして予測
Speculative_Sampling_LLM_Speed.pdf