newsie
-
[Fortnightly Tech Digest] Special Topic: Reasoning Model 오늘은 LLM 연구에서 핫한 주제인 추론(reasoning)에 대해 다뤄보려고 합니다. DeepSeek R1을 비롯해 많은 연구자들이 주목하고 있는 LLM의 강점(?)인데, LLM 연구의 맥락에서 추론이란 무엇인지, 어떻게 추론 능력을 향상시키는지 살펴보려고 해요. *이 포스트는 Substack.com의 Ahead of AI 소식지[1]를 참고하여 작성하였습니다.**틀린 부분이 (많이) 있을 수도 있습니다. 가감없이 피드백 부탁드립니다..What is Reasoning?서두에서 언급했다시피, reasoning을 직역하면 추론입니다. 추론은 사전적 정의에 따르면 '미루어 생각하여 논'하는 능력을 말하는데요, 이걸 LLM에게 가르친다면 가장 중요한 포인트는 '생각'이 되겠네요. 즉 LLM과 자연어처리의 맥락..
-
[Fortnightly Tech Digest] New Year's Edition 1월 4-5주차 주요 뉴스DeepSeek R1 crushing AmericaStargate: Trump's Ambition on AI(Paper) Murre: Multi-Hop Table Retrieval with Removal for Open-Domain Text-to-SQLTech News BriefingThe DeepSeek Effect얼마 전 AI의 신흥 강자가 나와 미국의 빅 테크와 주식 시장을 쑥대밭으로 만들어 놓았습니다. DeepSeek 사의 최신 모델 DeepSeek-R1(이하 R1)인데요, 다양한 벤치마크에서 o1은 물론 다른 모델들보다도 월등히 뛰어난 성능을 보여주고 있어요. R1은 기존 모델들과 아래와 같은 점에서 차별점을 가져요[1, 2].모델 이름에서 R은 강화학습(Reinforc..
-
[Fortnightly Tech Digest] Year-End to New Beginnings 12월 4주차 ~ 1월 1주차 주요 뉴스The Future of AI (@ NeurIPS 2024 Talks) by Ilya SutskeverAI & Privacy (feat. Apple)ModernBERT by Answer.AITech News BriefingThe Future of AI*이 단락은 일간 뉴스레터 The Neuron의 12월 20일자 포스트를 참고하여 작성하였습니다[1].일리야 서츠케버는 OpenAI의 공동창립자이자 SSI Inc.의 설립자입니다. 24년 노벨 물리학상의 수상자인 제프리 힌턴의 지도학생이기도 했어요. 아무튼 이 사람이 최근에 열린 NeurIPS 2024에서 AI의 미래에 대해 토크를 했었어요. 짧은 토크이기는 하지만 그래도 AI 전문가가 직접 제시하는 AI의 전망이라는 ..
teach me
- LEC06: Agents for Software Development w/ Graham Neubig 뭔가 이미 잘 정리된 파워포인트를 가지고 또 내용을 정리하는 건 무의미할 것 같아서.. 그 강의에서 다룬 논문이나 플젝을 살펴보는 것으로 하겠음ㅎ 이번 강의는 code generation을 주로 다루고 있어서, 그 중에서도 SWE-bench에 대해 조금 더 찾아보았어요. 아래는 공식 사이트에서 다루고 있는 타임라인입니다.📣 [10/2024] Introducing SWE-bench Multimodal! Can AI systems "see" bugs and fix them? 👀 💻📣 [08/2024] SWE-bench x OpenAI = SWE-bench Verified, a human-validated subset of 500 problems reviewed by software engineers!.. 2024.10.27
- LEC05: Compound AI Systems & the DSPy Framework w/ Omar Khattab Compound AI System처음 들어보는 개념이라 메모메모📝사람과 마찬가지로 AI 또한 오류로부터 자유롭지 못한데, 단일체 AI의 경우에는 이러한 오류를 잡기 위한 디버깅이 까다롭기 때문에 통제 및 제어가 매우 어렵다고 해요. 그래서 여러 AI가 각각 특화된 구성요소 하나로서 동작하는 모듈러 시스템을 만들겠다는 의미예요. 쉽게 말해, 모든 태스크를 하나의 AI로 해결하는 대신 태스크를 세분화해서 각각 하나의 AI에게 맡기겠다는 거죠. RAG(Retrieval-Augmented Generation)도 이러한 예시 중 하나예요. 어떤 질문이 들어왔을 때, 물론 요즘 LLM은 워낙 방대한 양의 데이터로 학습해서 굳이 RAG 없이도 동작할 수 있지만.. 자사의 비공개 문서들에서 정보를 찾아야 하는 경우 .. 2024.10.20
- LEC04: Enterprise Trends for Generative AI w/ Burak Gokturk 네 번째 강의까지 듣고 나니 이 수업이 왜 MOOC일 수밖에 없었는지 조금이나마 이해가 갑니다.. 한 분야의 권위자들이 진행하는 1시간짜리 Ted Talks를 매주 듣기 때문에 현재 연구의 트렌드를 알기엔 제격이지만 단계적인 '커리큘럼'이라는 것이 없어서 넓고 얕게 LLM Agent 관련 지식을 음미하는 느낌? 이번 강연의 연사는 구글 클라우드에서 일하는 AI/ML 엔지니어 Gokturk입니다. 따라서 DeepMind 출신의 연사들의 강연과 달리, 제목처럼 좀 enterprise 측면에서의 LLM Agent를 엿볼 수 있었어요. LLM Evolution & Gemini강연 초반에서는 최근에 있었던 LLM의 비약적 발전을 짧게 언급하고 있습니다. 트랜스포머의 등장부터 Next token prediction.. 2024.10.12
medical?
-
MedAI) Search-Adaptor: Embedding Customization for Information Retrieval 2024.07.21
-
MedAI) Personal LLM Agents 2024.07.20
-
MedAI) LLM-based Medical Assistant Personalization with Short- and Long-Term Memory Coordination 2024.07.20