<aside> ✨ 스터디 신청 바로가기(링크) 신청기간: 9/1(화)~9/17(목) 선발결과: 9/30(수) 개별 안내
</aside>
<aside> 💡
모델링 · 대시보드 기획/개발/운영 · Hive/Athena
10년 동안 데이터와 분석 요청을 받는 쪽에 서 있었습니다. 대부분은 특정 숫자를 대신 뽑아달라는 것이었는데, 질문이 어려워서가 아니라 그 숫자의 정의를 잡고 테이블 구조를 아는 사람이 한정돼 있어서 매번 사람이 병목이 된다는 걸 느꼈습니다.
작년부터 이걸 자동화해보려 했지만 조금만 복잡해지면 답이 무너져서 몇 번이나 중간에 멈췄습니다. 왜 틀리는지 알아내려면 프롬프트를 만지는 것보다 구조를 뜯어봐야 한다는 걸 알게 됐고, 그건 혼자 할 일이 아니라고 판단해 스터디를 열게 되었습니다.
스터디를 진행하면서 좋은 분들과 소중한 시간을 아낌없이 쓸 수 있기를 기대하고 있습니다.
8주라는 시간 동안 즐겁게 스터디하고, 좋은 인연을 나눌 수 있는 다양한 분들을 기다리고 있겠습니다 ♥
</aside>
🔎 스터디 주제:
🎯 목표:
🚩 프로젝트 결과물 계획:
<aside> 💡
각자 하나씩 만드는 방식이 아니라, 하나의 에이전트를 나눠 만듭니다. 대신 담당 모듈과 커밋 이력이 남아서 각자 자기 몫을 들고 나갈 수 있게 설계할 예정입니다.
</aside>
✅ 대상:
<aside> 💡
아래의 그 어떤 것보다 가장 중요한 것 하나! “중도 하차 없이 8주를 끝까지 함께해주실 분”을 찾습니다.
</aside>
🔥 모집정원: 리더 포함 7명
🛠️ 진행방식: 혼합(격주 서울 내 스터디룸에서 오프라인으로 진행 예정, 장소는 서울 대방역, 서울가족플라자 또는 종로/강남)
📦 사전 준비물 / 개발환경:
OpenAI API 공식 문서의 Function calling 섹션
Spider, BIRD 같은 Text-to-SQL 벤치마크 소개 글 — 이 분야에서 뭘 어려워하는지 감을 잡는 데 도움이 됩니다
※ 실습 데이터는 공공데이터포털·Kaggle 공개 데이터셋을 사용하며 DB는 로컬 환경 기준이라, 지급되는 Codex 크레딧 $300 외에 별도 비용은 거의 발생하지 않습니다. 다만 배포 환경을 따로 구성할 경우 소액의 개인 비용이 생길 수 있습니다.
진행일정:
| 회차 | 일정 및 방식 | 주제 | 구체적인 진행 내용 | 회차별 결과물 |
|---|---|---|---|---|
| 1회차 | 10월 2일(금) / 오프라인 | 팀 OT: 우리가 자동화하려는 질문은 무엇인가 | 팀원 소개와 스터디 운영 방식을 안내합니다. 각자 실무나 학습 과정에서 반복적으로 던지는 데이터 질문을 모아보고, 그중 무엇을 에이전트가 대신 답하게 만들지 정합니다. 실습에 사용할 공개 데이터셋을 함께 선정하고 담당 모듈을 나눕니다. | 질문 목록 20개 내외, 데이터셋 선정, 모듈별 역할 분담표 |
| 2회차 | 10월 하순 / 온라인 | 베이스라인 구현과 실패 케이스 수집 | 공개 데이터셋을 SQLite로 구축해 레포에 포함시킵니다. 클론 후 전원이 동일한 환경에서 시작할 수 있도록 합니다. 스키마를 프롬프트에 그대로 넣는 가장 단순한 형태로 Text-to-SQL을 구현해보고, 어떤 질문에서 어떻게 틀리는지 실패 사례를 모읍니다. | 공용 SQLite DB, 동작하는 베이스라인 코드, 실패 케이스 정리 |
| 3회차 | 11월 초 / 오프라인 | 평가셋 구축과 정확도 측정 | 질문-정답 쿼리 쌍 50문항 규모의 평가셋을 함께 만듭니다. 무엇을 정답으로 볼지(쿼리 일치인지 결과 일치인지) 기준을 정하고, 베이스라인 정확도를 측정해 이후 개선의 기준점을 세웁니다. | 평가셋 50문항, 자동 채점 스크립트, 베이스라인 정확도 |
| 4회차 | 11월 중순 / 온라인 | 스키마 컨텍스트 설계 | DDL 주입 방식, few-shot 예시 구성, 컬럼 설명과 비즈니스 용어 사전, 테이블 관계 그래프를 각각 적용해보고 정확도 변화를 비교합니다. 자연어 용어와 컬럼을 어떻게 잇느냐가 정확도를 좌우한다는 점을 숫자로 확인합니다. | 용어 사전, 관계 그래프, 방식별 정확도 비교표 |
| 5회차 | 11월 말 / 오프라인 | 자가수정 루프와 안전 하네스, 통합 | 쿼리 실행이 실패했을 때 에러를 파싱해 재작성하고 재실행하는 루프를 구현합니다. 몇 번까지 재시도할지, 언제 포기하고 모른다고 답할지 종료 조건을 설계합니다. 쿼리 타임아웃, 반환 row 제한, 읽기 전용 접근도 함께 붙입니다. | |
| 결과 해석·시각화 레이어를 붙여 리포트까지 이어지는 전체 흐름을 완성합니다. 최종 정확도를 측정해 시작 시점과 비교하고, 무엇이 효과가 있었는지 정리합니다. 시연과 함께 각자 담당 모듈을 공유합니다. | 자가수정 루프, 안전 하네스, 개선된 정확도, 완성된 에이전트, 공개 GitHub 레포, 시연 데모, 발표 자료 초안 | |||
| 6회차 | 12월 16일(수) / 오프라인 | 결과공유회 | 최종 결과물을 공유합니다. | 완성된 에이전트, 공개 GitHub 레포, 시연 데모, 발표 자료 |