Toolformer Paper review
사람 어노테이션 없이 LM이 스스로 도구 사용법을 배운다. ‘이 도구 호출이 다음 토큰 예측을 쉽게 하는가’라는 필터 하나로 학습 데이터를 만든 논문.
사람 어노테이션 없이 LM이 스스로 도구 사용법을 배운다. ‘이 도구 호출이 다음 토큰 예측을 쉽게 하는가’라는 필터 하나로 학습 데이터를 만든 논문.
실패를 반성문으로 남겨 다음 시도에 써먹는 에이전트. 가중치 업데이트 없는 ‘말로 하는 강화학습’으로 HumanEval 91%를 찍었다.
지금 모든 LLM Agent의 뼈대가 된 논문. Thought → Action → Observation 루프부터 LangChain create_agent까지 뜯어본다.
Llama Guard: LLM-based Input-Output Safeguard for Human-AI Conversations
Proxy-tuning: Tuning Language Models by Proxy
SOLAR 10.7B: Scaling Large Language Models with Simple yet Effective Depth Up-Scaling Paper review
[네이버 클로바 스튜디오 X 포텐데이] 참여 후기
효율적인 LLM 학습 전략
A Survey of Large Language Models 논문 리뷰
딥스피드 백그라운드 프로세스 죽이는 법