# 칼퇴공학연구소 (KALTI) — 전체 내용 > 칼퇴공학연구소(KALTI)는 AI와 함께 일하는 방법을 직접 실험하는 대한민국의 독립 연구 모임이다. 2026년 6월 8일 창립총회를 열어 규약을 정하고 대표를 뽑았다. 연구원 세 명이 각자 맡은 종목을 실험하고, 한 일을 모두 연구일지로 남기고, 여러 종목이 따로 닿은 결론만 골라 함께 쓰는 지식으로 쌓는다. 이 문서는 https://kalti.co.kr 의 내용을 언어모델이 읽기 좋게 한 파일에 모은 것이다. 숫자는 모두 연구일지 저장소에서 직접 센 값이고 2026년 10월 9일 기준이다. 짧은 요약은 https://kalti.co.kr/llms.txt 에 있다. 홈페이지는 한국어판(https://kalti.co.kr/)과 같은 구성의 영어판(https://kalti.co.kr/en/)이 있다. ## 기본 정보 - 이름: 칼퇴공학연구소 (영문 KALTI) - 이름의 뜻: 제때 퇴근한다는 뜻의 '칼퇴' - 형태: 규약과 대표를 둔 독립 연구 모임 - 창립: 2026년 6월 8일 창립총회 (단체 설립, 규약 승인, 대표자 선임) - 구성원: 연구원 3명 (aram 대표, jinsik, sunghyun) - 지역: 대한민국 - 홈페이지: https://kalti.co.kr (도메인 2026년 6월 9일 등록) - GitHub: https://github.com/kalti-lab (2026년 6월 19일 개설). 연구일지 원본 저장소는 비공개이고, 연구일지 Claude Code 스킬 저장소(https://github.com/kalti-lab/claude-plugins)는 공개다. - 연락: aram@kalti.co.kr - 연구일지: 428편 (첫 기록 2025년 10월) - 지식 카드: 493장 (발견 264, 가설 95, 결정 77 외) - 개념: 13개 - 연구 종목: 37개 (진행 30, 보류 5, 완료 2). 개인 종목 5개를 뺀 32개를 공개한다. - 주간 보고서: 46편 - 월간 연구 소식: 창간호(2026년 8월호, 2026-09-11 펴냄), 제2호(2026년 9월호, 2026-10-02 펴냄) ## 연구 방식 1. 연구일지: 그날 한 실험·조사·결정을 각자 자기 폴더에 쓴다. 일지는 증거라서 쓴 사람만 고친다. 2. 지식 카드: 일지에서 발견·가설·결정을 뽑아 카드로 올린다. 카드는 반드시 근거 일지를 가리킨다. 틀렸거나 바뀐 생각도 지우지 않고 왜 버렸는지 남긴다. 3. 개념: 여러 종목이 서로 모르고 각자 하다가 같은 결론에 닿은 것만 개념으로 묶는다. 4. 연구 소식: 매주 사람별 주간 보고서를, 매달 연구실 전체를 담은 월간 소식을 낸다. 이 과정은 Claude Code 스킬 다섯 개로 돌아간다: kalti-setup(볼트 위치·본인 폴더·동기화), kalti-journal(오늘 한 일을 일지로), kalti-ontology(일지에서 결론을 뽑아 카드로), kalti-report(주간 보고서·월간 소식), kalti-context(이 주제로 이미 알아낸 것). ## 알아낸 것: 여러 종목이 따로 닿은 결론 괄호 안은 그 결론에 닿은 종목 수와 근거가 된 발견 카드 수다. 1. 평가 정직성 (종목 16곳, 발견 35건): 결론을 믿기 전에, 그 결론을 재는 도구가 먼저 정직해야 한다. 2. 조용한 실패 (종목 16곳, 발견 26건): 에러 없이 성공처럼 보이는 실패는 몇 주 뒤에야 드러난다. 3. 검증 게이트의 한계 (종목 13곳, 발견 22건): 초록불은 그 검사가 재는 것만 증명한다. 4. 교체 비용과 경계 설계 (종목 11곳, 발견 15건): 바뀔 것을 한 겹 뒤에 숨겨 두면 나중에 갈아 끼우기가 쉽다. 5. 장기기억 회상층 (종목 7곳, 발견 15건): 세션을 넘겨 기억을 쌓고, 지금 맞는 것만 꺼내 온다. 6. 실행 환경 고정 (종목 7곳, 발견 9건): 무엇이 실제로 돌았는지 고정하지 않으면, 환경 탓을 대상 탓으로 알게 된다. 7. 겉모습 판정 (종목 5곳): 이름이나 형식으로 판정하면 같은 것을 못 알아본다. 8. 안 갈리는 축 (종목 5곳): 한 축을 끝까지 쓸어도 결과가 같은 범위에 머물면, 그 축은 손잡이가 아니다. 9. LLM 심판의 신뢰성 (종목 5곳): 정답지 없는 채점을 모델에게 맡길 때 어디까지 믿을 수 있는지 잰다. 10. 고장은 주고받는 길에 있다 (종목 4곳): 성능이 모자라 보이는 증상이 실은 부품끼리 주고받는 방식에서 나온다. 11. 받는 쪽이 형식을 정한다 (종목 3곳): 내용은 만드는 쪽이 정하지만, 형식은 받는 앱과 기기가 정한다. 12. 모델 등급이 설계를 가른다 (종목 3곳): 어떤 방법이 통한다는 결론은 그걸 돌린 모델과 묶여 있다. 13. 로컬 서비스 출처 검사 (종목 3곳): 개발용으로 띄운 서비스도 밖에서 열릴 수 있다고 보고 출처를 검사한다. ## 공개 종목 32개 종목마다 상태 · 그 종목으로 쓴 연구일지 수 · 지식 카드 수 · 마지막 일지 날짜를 적었다. ### AI 에이전트와 기억 (AI agents & memory) - **neuromem** (진행 · 일지 42편 · 카드 48장 · 최근 2026-09-26) AI 에이전트가 자기가 누구인지와 겪은 일을 오래 쌓아 두고, 지금 상황에 맞는 기억을 연관으로 골라 꺼내는 장기기억 엔진입니다. EN: A long-term memory engine that lets an AI agent keep who it is and what it has been through, and recall the memories that fit the moment by association. - **mnemosure** (진행 · 일지 14편 · 카드 30장 · 최근 2026-09-07) 여러 세션에 걸친 AI 코딩 협업에서 기억 누락과 환각을 줄이는 기억층입니다. 모르면 모른다고 하고, 아는 건 출처와 함께 답하게 합니다. EN: A memory layer that cuts forgotten context and hallucination in AI coding across sessions. It says "I don't know" when it doesn't, and answers with sources when it does. - **numen** (진행 · 일지 15편 · 카드 22장 · 최근 2026-08-09) Claude Code·Codex·Gemini CLI를 고치지 않고 상자로 띄워 캔버스에서 잇고, 누가 언제 켜지고 실패하는지 다 보이게 하는 멀티에이전트 실행기입니다. EN: A multi-agent runner that launches Claude Code, Codex and Gemini CLI unmodified as boxes on a canvas, wires them together, and shows who started when and what failed. - **honcho-selfhost** (진행 · 일지 42편 · 카드 9장 · 최근 2026-10-07) 오픈소스 기억 서버 Honcho를 직접 띄워, Claude·Codex·Gemini가 함께 쓰는 장기기억 저장소로 운영합니다. EN: Runs the open-source memory server Honcho on our own machines as a long-term memory store shared by Claude, Codex and Gemini. - **인간기억 기반 메모리** (진행 · 일지 1편 · 카드 6장 · 최근 2026-07-01) 인지심리학과 신경과학의 기억 연구를 모아, 사람 기억을 본뜬 메모리 시스템의 설계 근거를 만듭니다. EN: Gathers memory research from cognitive psychology and neuroscience to ground the design of a memory system modeled on human memory. - **기억시스템 통합** (진행 · 일지 0편 · 카드 1장 · 최근 없음) 기억을 다루는 종목 다섯의 경계를 정하고, 무엇을 남기고 무엇을 접을지 한 저울에 올려 판단합니다. EN: Draws the boundaries between our five memory projects and weighs on one scale what to keep and what to fold. ### LLM 측정과 평가 (LLM evaluation) - **직렬화 포맷과 토큰 정확도** (진행 · 일지 9편 · 카드 11장 · 최근 2026-08-21) 같은 데이터를 JSON·YAML·CSV·마크다운 표 등 일곱 가지로 바꿔 넣으며, LLM의 정답률과 토큰 수가 어떻게 달라지는지 원인부터 잽니다. EN: Feeds the same data to LLMs in seven formats, including JSON, YAML, CSV and Markdown tables, and traces why accuracy and token counts change. - **ai-coding-arch** (완료 · 일지 3편 · 카드 6장 · 최근 2026-09-12) "아키텍처가 AI 코딩을 돕는가"를 코드 구조 15가지, 209칸으로 직접 재서 판정했습니다. 번지는 고장을 가른 것은 구조가 아니라 모델 등급이었습니다. EN: Tested "does architecture help AI coding?" across 15 code structures and 209 cells. What separated cascading failures was not the structure but the model tier. - **llm-bench** (보류 · 일지 21편 · 카드 28장 · 최근 2026-08-12) 공개 순위표가 아니라 "내 실사용에 어느 모델이 맞나"를 여러 축으로 재는 벤치마크입니다. EN: A benchmark that measures on several axes which model fits our own everyday use, rather than public leaderboards. ### 개발 도구와 자동화 (Developer tools & automation) - **agrune** (진행 · 일지 21편 · 카드 25장 · 최근 2026-08-16) 자체 LLM 없이 어떤 에이전트든 MCP로 붙여, 화면 좌표 대신 뜻 단위로 웹 페이지를 다루게 하는 브라우저 제어 층입니다. EN: A browser-control layer with no LLM of its own. Any agent connects over MCP and handles web pages by meaning instead of screen coordinates. - **dsforge** (진행 · 일지 11편 · 카드 14장 · 최근 2026-09-11) Figma 시안에서 디자인 시스템, 코드까지 옮기는 과정이 충실한지를 사람의 말이 아니라 기계 측정으로 검증합니다. EN: Verifies by machine measurement, not human judgment, whether the path from Figma mockups to a design system and code stays faithful. - **dsmonitor** (진행 · 일지 6편 · 카드 11장 · 최근 2026-09-14) 코드·스타일·디자인의 일관성을 수치로 재는 CLI 도구입니다. npm 패키지 dsmonitor로 냅니다. EN: A CLI that scores the consistency of code, styles and design. Published on npm as dsmonitor. - **pidgin** (진행 · 일지 5편 · 카드 3장 · 최근 2026-09-12) AI와 사람이 좌표가 아니라 의미를 함께 고치는 캔버스입니다. EN: A canvas where AI and people edit meaning together, not coordinates. - **n8n 자동화** (진행 · 일지 1편 · 카드 4장 · 최근 2026-07-21) 상주 봇 없이 n8n만으로 디스코드 명령을 받아 이미지 생성 워크플로를 돌립니다. EN: Runs image-generation workflows from Discord commands with n8n alone, without an always-on bot. - **agent-bar** (진행 · 일지 10편 · 카드 1장 · 최근 2026-10-02) 여러 AI 공급자의 사용량을 macOS 메뉴바에서 한눈에 보여 주는 도구입니다. 데이터가 일부만 와도 뜻을 왜곡하지 않게 그립니다. EN: A macOS menu bar tool that shows usage across AI providers at a glance, and draws partial data without distorting what it means. - **연구일지 시스템** (진행 · 일지 15편 · 카드 39장 · 최근 2026-09-16) 연구원이 한 일을 일지로 남기고, 결론을 뽑아 지식 그래프로 쌓는 이 연구소의 기록 시스템입니다. 이 페이지의 숫자도 여기서 나옵니다. EN: This lab's record system: researchers log their work as journals and refine conclusions into a knowledge graph. The numbers on this site come from it. - **연구기록 체계** (진행 · 일지 2편 · 카드 8장 · 최근 2026-07-09) 대학·기업·연구소가 연구기록을 어떻게 정리하는지 조사해, 연구노트와 주간 보고의 틀을 세웠습니다. EN: Surveyed how universities, companies and institutes keep research records, and set the format of our lab notes and weekly reports. ### 직접 만드는 것 (Things we build) - **3d-fabrication** (진행 · 일지 3편 · 카드 1장 · 최근 2026-09-11) AI가 3D 프린팅 모델(STL)을 직접 고치고 검사하는 격리된 Blender 환경을 만들고, 그 위에서 실제 출력물을 다시 설계합니다. EN: Builds an isolated Blender environment where AI edits and checks 3D-printing models (STL) directly, then redesigns real prints with it. - **toython** (진행 · 일지 3편 · 카드 6장 · 최근 2026-08-27) 버튼 여섯 개와 마이크를 손에 쥐고 쓰는 음성 입력 장치입니다. 받아쓰기는 Mac의 로컬 Whisper가 맡습니다. EN: A handheld voice input device with six buttons and a microphone. Transcription runs on local Whisper on a Mac. - **ride-draft** (진행 · 일지 15편 · 카드 18장 · 최근 2026-08-14) 자전거 경로 초안을 지도에서 다듬고, 자전거 컴퓨터에 넣을 GPX로 내보내는 로컬 웹 도구입니다. EN: A local web tool for refining bike route drafts on a map and exporting them as GPX for a bike computer. - **wisp** (진행 · 일지 11편 · 카드 9장 · 최근 2026-08-05) 음성을 클라우드로 보내지 않고 기기 안에서 받아쓰는 macOS 앱입니다. EN: A macOS app that transcribes speech on the device, without sending audio to the cloud. - **aria** (진행 · 일지 10편 · 카드 4장 · 최근 2026-09-23) AI가 곡을 직접 만들고 재생하며, 사람은 브라우저에서 듣고 고치는 로컬 작곡 환경입니다. EN: A local composing environment where AI writes and plays music, and people listen and edit in the browser. - **locogic** (진행 · 일지 19편 · 카드 16장 · 최근 2026-07-29) 막힌 철도망을 최소 공사로 뚫는 결정론 퍼즐 게임이 성립하는지 Godot으로 확인합니다. EN: Checks in Godot whether a deterministic puzzle game about opening blocked rail networks with the fewest works holds up. - **sulnote** (진행 · 일지 8편 · 카드 7장 · 최근 2026-10-06) 위스키·와인·사케 테이스팅 노트와 구매처별 시세를 기록하고 취향을 분석하는 웹앱입니다. EN: A web app for whisky, wine and sake tasting notes and prices by shop, with taste analysis. - **novel** (진행 · 일지 9편 · 카드 9장 · 최근 2026-06-25) 한국 웹소설 한 편을 AI로 끝까지 써 보는 실험입니다. EN: An experiment in writing a Korean web novel all the way to the end with AI. - **broker-rogue** (진행 · 일지 1편 · 카드 0장 · 최근 2026-09-14) 매일 받는 트레이딩 카드로 시장에 개입하는 로그라이트 주식 생존 게임입니다. React Native와 Expo로 만들었습니다. EN: A roguelite stock-survival game where you move the market with daily trading cards. Built with React Native and Expo. - **ktheme-works** (진행 · 일지 4편 · 카드 14장 · 최근 2026-09-16) 카카오톡 테마를 손으로 그리지 않고 코드로 만들어 냅니다. 색 하나만 바꿔도 전부 다시 나옵니다. EN: Generates KakaoTalk themes from code instead of drawing them by hand. Change one color and everything regenerates. - **이미지 생성 파이프라인** (진행 · 일지 12편 · 카드 10장 · 최근 2026-10-07) SDXL과 ComfyUI로, 누가 돌려도 같은 결과가 나오는 이미지 생성 프리셋을 만듭니다. EN: Builds SDXL and ComfyUI image-generation presets that give the same result no matter who runs them. - **screen-translate** (보류 · 일지 7편 · 카드 10장 · 최근 2026-06-25) 화면의 외국어를 그 자리에서 한국어로 바꿔 보여 주는 크롬 확장과 Mac 앱입니다. EN: A Chrome extension and Mac app that turns foreign text on screen into Korean in place. - **jarvis** (보류 · 일지 3편 · 카드 4장 · 최근 2026-06-25) 이미 쓰는 Codex 위에 음성과 HUD만 얹은 로컬 음성 비서입니다. EN: A local voice assistant that adds only voice and a HUD on top of the Codex we already use. ### 같이 배우기 (Learning together) - **rag-chatbot-study** (진행 · 일지 1편 · 카드 0장 · 최근 2026-09-14) 올린 문서를 근거로 답하는 RAG 챗봇을 만들며 공부한 학습 프로젝트입니다. EN: A study project building a RAG chatbot that answers from uploaded documents. - **ax-hackathon** (완료 · 일지 12편 · 카드 13장 · 최근 2026-07-23) 조코딩AX·프라이머 'AX 인재전쟁' 해커톤에 나가, 기업별 문제를 푸는 Codex 플러그인을 만들었습니다. EN: Joined the "AX Talent War" hackathon by JocodingAX and Primer, and built Codex plugins that solve each company's problem. ## 월간 연구 소식 - 제2호 (2026년 9월호, 2026-10-02 펴냄) — "검사가 조용하다고 깨끗한 건 아니었다". 9월에 가장 많이 들여다본 것은 연구일지 저장소 자신이었다. 검사가 문제없다고 하던 곳에서 검사가 놓친 것이 계속 나왔고, 원인은 하나였다. 글로만 적은 규칙은 누가 기억해야만 지켜진다. 기계로 잡을 수 있는데 검사 코드가 확인하지 않던 규칙 56건, 검사가 아예 안 보던 곳에 남아 있던 금지 낱말 19건, "뽑을 결론 없음"으로 넘겼다가 다시 읽어 보니 결론이 나온 일지 33편 중 30편. 그달 일지 31편, 새로 알아낸 것 51, 새로 정한 것 25, 결론 난 생각 2. 이달의 연구: 연구일지 시스템. - 창간호 (2026년 8월호, 2026-09-11 펴냄) — "모델에게 생각을 시키면 포맷 차이가 없어질 줄 알았다". 풀이 과정을 쓰게 하자 포맷 사이의 정답률 차이는 줄지 않고 오히려 커졌다. 8월에 결론 난 생각 열 건 가운데 다섯은 "아니었다"였다. 그달 일지 49편, 새로 알아낸 것 44, 새로 정한 것 1, 결론 난 생각 10. 이달의 연구: 직렬화 포맷과 토큰 정확도. ## 자주 묻는 질문 ### 칼퇴공학연구소(KALTI)는 어떤 곳인가요? 칼퇴공학연구소(KALTI)는 AI와 함께 일하는 방법을 직접 실험하는 대한민국의 독립 연구 모임입니다. 2026년 6월 8일 창립총회에서 규약을 정하고 대표를 뽑았고, 연구원 세 명이 각자 맡은 종목을 실험해 모두 연구일지로 남깁니다. ### 이름의 '칼퇴'는 무슨 뜻인가요? 제때 퇴근한다는 뜻의 '칼퇴'에서 왔습니다. 영문 이름은 KALTI이고, 홈페이지 주소는 kalti.co.kr입니다. ### 무엇을 연구하나요? AI 에이전트와 기억, LLM 측정과 평가, 개발 도구와 자동화, 직접 만드는 것, 같이 배우기의 다섯 분야에서 공개 종목 32개를 연구합니다. 예를 들어 AI 에이전트의 장기기억 엔진(neuromem), 데이터 포맷에 따라 LLM 정답률이 어떻게 달라지는지 재는 실험, MCP로 붙는 브라우저 제어 도구(agrune)가 있습니다. ### 연구는 어떻게 기록하고 정리하나요? 그날 한 실험·조사·결정을 연구일지로 쓰고, 일지에서 발견·가설·결정을 뽑아 지식 카드로 올립니다. 여러 종목이 따로 닿은 결론만 개념으로 묶고, 매주 주간 보고서와 매달 월간 연구 소식을 냅니다. 2026년 10월 9일 기준 연구일지 428편, 지식 카드 493장, 개념 13개입니다. ### 지금까지 무엇을 알아냈나요? 가장 많은 종목이 따로 닿은 결론은 세 가지입니다. 결론을 믿기 전에 그 결론을 재는 도구가 먼저 정직해야 한다(평가 정직성, 종목 16곳). 에러 없이 성공처럼 보이는 실패는 몇 주 뒤에야 드러난다(조용한 실패, 종목 16곳). 초록불은 그 검사가 재는 것만 증명한다(검증 게이트의 한계, 종목 13곳). ### 연구 기록과 도구를 볼 수 있나요? 연구일지 원본은 연구원끼리 쓰는 비공개 저장소에 있고, 이 홈페이지에 종목별 요약과 숫자를 공개합니다. 연구일지를 쓰고 정리하는 Claude Code 스킬은 GitHub(github.com/kalti-lab/claude-plugins)에 공개되어 있습니다. ### 홈페이지의 숫자는 어디서 나오나요? 모두 연구일지 저장소에서 직접 센 값입니다. 사이트를 만들 때마다 새로 세며, 지금 숫자는 2026년 10월 9일 기준입니다. ### 연락은 어떻게 하나요? 메일(aram@kalti.co.kr)로 받습니다. 연구 내용, 협업, 자료 요청 모두 괜찮습니다. ## English KALTI (칼퇴공학연구소) is an independent research group in South Korea, founded on June 8, 2026, to study software development and engineering together. At the founding meeting the members adopted a charter and elected a representative. The name comes from "kaltoe" (칼퇴), Korean slang for leaving work right on time. Three researchers each run their own projects, most of them about working alongside AI: long-term memory for AI agents, measuring LLMs, developer tools that agents use, and things we build with AI. Every piece of work is logged as a research journal, and conclusions worth keeping are refined into a shared knowledge base. As of October 9, 2026: 428 research journals, 493 knowledge cards, 13 concepts, 37 projects. ### What is KALTI (칼퇴공학연구소)? KALTI is an independent research group in South Korea that experiments with working alongside AI. It was founded at a founding meeting on June 8, 2026, where the members adopted a charter and elected a representative. Three researchers each run their own projects and log everything as research journals. ### What does the name mean? It comes from the Korean slang "kaltoe" (칼퇴), which means leaving work right on time. The English name is KALTI, and the website is kalti.co.kr. ### What does KALTI research? 32 public projects across five areas: AI agents and memory, measuring and evaluating LLMs, developer tools and automation, things we build, and learning together. Examples include a long-term memory engine for AI agents (neuromem), an experiment measuring how data formats change LLM accuracy, and a browser-control layer that agents use over MCP (agrune). ### How is the research recorded? Each day's experiments, research and decisions go into a research journal. Findings, hypotheses and decisions are pulled from journals into knowledge cards, and only conclusions that several projects reached independently become concepts. Each researcher writes a weekly report, and the lab publishes a monthly digest. As of October 9, 2026, there are 428 journals, 493 knowledge cards and 13 concepts. ### What has KALTI found so far? The three conclusions reached by the most projects: a measuring tool must be honest before you trust its result (honest evaluation, 16 projects); failures that look like success, with no error, surface only weeks later (silent failure, 16 projects); and a green check proves only what that check measures (limits of verification gates, 13 projects). ### Can I see the records and tools? The raw journals live in a private repository shared by the researchers; this website publishes per-project summaries and counts. The Claude Code skills used to write and refine the journals are public at github.com/kalti-lab/claude-plugins. ### Where do the numbers on this site come from? Every number is counted directly from the research journal repository each time the site is built. The current figures are as of October 9, 2026. ### How can I contact KALTI? By email at aram@kalti.co.kr, for research questions, collaboration or requests for materials. ## 링크 - 홈페이지: https://kalti.co.kr/ - 프로젝트 전체: https://kalti.co.kr/projects/ - English: https://kalti.co.kr/en/ - Projects (English): https://kalti.co.kr/en/projects/ - GitHub: https://github.com/kalti-lab - 연구일지 Claude Code 스킬: https://github.com/kalti-lab/claude-plugins