Recent posts

Toolformer Paper review

사람 어노테이션 없이 LM이 스스로 도구 사용법을 배운다. ‘이 도구 호출이 다음 토큰 예측을 쉽게 하는가’라는 필터 하나로 학습 데이터를 만든 논문.

Reflexion Paper review

실패를 반성문으로 남겨 다음 시도에 써먹는 에이전트. 가중치 업데이트 없는 ‘말로 하는 강화학습’으로 HumanEval 91%를 찍었다.

ReAct Paper review

지금 모든 LLM Agent의 뼈대가 된 논문. Thought → Action → Observation 루프부터 LangChain create_agent까지 뜯어본다.

SOLAR Paper review

SOLAR 10.7B: Scaling Large Language Models with Simple yet Effective Depth Up-Scaling Paper review