0 旧サイトリンク

Paper Summary

1 AIが学習する仕組み

1.1 RLHF : 人間の評価をもとにした強化学習

InstructGPT_Alignment_and_RLHF.pdf

1.2 Verify Step By Step : 導出過程を全て評価し、部分点を与える

Verify_Step_By_Step.pdf

2 AIエージェントが賢い理由

1.1 Chain of Thought : 考えてから答える

Chain_of_Thought_LLM_Reasoning.pdf

1.2 Tree of Thought : 複数の選択肢を考慮して答える

Tree_of_Thoughts_LLM_Deliberation.pdf

1.3 ReAct : 考えながら行動をアップデートする

ReAct_Reasoning_and_Acting_Agents.pdf

1.4 Toolformer : AI電卓などのツールを使って回答する

Toolformer_LLMs_Teach_Themselves_Tools.pdf

3 賢いAIが安く早く使えるようになった理由

3.1 Speculative Sampling : 次の言葉を軽量モデルで先回りして予測

Speculative_Sampling_LLM_Speed.pdf