Jev로 메모리를 고르고 나누기, 문맥을 지우는 일은 다르다
Supermemory의 Jev 탐색 실험을 재정렬·청킹·메모리 추출 전 필터링·주입 판단으로 나누고 품질과 비용, 문맥 손실의 조건을 대조한다.
TL;DR
- Jev는 메모리 내용을 직접 작성하기보다 검색 결과의 순서와 청크 경계, 검색 실행 여부를 고르는 데 쓰인다. Supermemory 창업자 Dhravya Shah는 파이프라인 여러 지점에 넣어 본 탐색 결과를 공유했다. 모든 실험이 운영 환경에서 검증됐다는 발표는 아니다.
- 공개 검색 평가에서 Jev는 BM25의 초기 결과를 개선했지만 전용 재정렬 모델을 일관되게 앞서지는 못했다. 공통 세 데이터셋 평균은 BGE보다 높고 jina-reranker-turbo보다 낮았다. 저자도 현재 비용·품질을 고려하면 전용 재정렬 모델을 유지하겠다는 입장이다.
- 내부 청킹 실험은 문서 36개와 질문 72개, 여섯 언어를 사용했다. 320자 청크에서 Jev 두 방식의 최상위 검색 청크 정답 포함률은 93%였다. 다른 크기와 언어별 결과에서는 순위가 달라져 완벽한 청킹이나 보편적인 최고 성능으로 일반화할 수 없다.
- 메모리 추출 전 문장을 거르는 실험은 내용 토큰을 58% 줄였지만 문장 사이의 참조 관계를 손상시켰다. 버린 제안이나 정의가 뒤의 발언을 해석하는 데 필요할 수 있었다. 토큰 절감만으로 기억 품질과 전체 비용 개선을 판단할 수 없다.
- 검색 여부를 하네스 훅에서 판단하는 실험과 실제 플러그인의 현재 동작은 구분해야 한다. 원문은 Jev가 검색을 고르는 방식을 제안하지만 공개 문서는 Claude의 reasoned recall을 설명한다. 기억 사용 거부 같은 사용자 지시를 항상 지킨다는 보장도 별도 검증이 필요하다.
메모리 저장 방식보다 공통 처리 단계를 본다
Dhravya Shah는 Supermemory의 특정 저장 구조를 떠나 에이전트 메모리의 공통 단계를 살폈다. 메시지와 파일, 도구 결과가 현재 문맥에 들어가는 한편 일부는 묶이거나 나뉘어 별도의 관찰·학습 과정으로 전달된다. 만들어진 기억은 Markdown 파일과 벡터 저장소, 그래프나 KV 등 여러 형태로 저장할 수 있다. 이후 요약·프로필을 주입하거나 검색을 거쳐 필요한 내용을 에이전트 문맥으로 돌려보낸다.
이 설명에서 검색은 벡터 유사도만을 뜻하지 않는다. grep이나 파일 읽기도 저장된 정보를 다시 찾는 경로이며 관찰 작업은 일정이나 이벤트에 따라 주 대화 루프 밖에서 실행될 수 있다. Jev는 이 과정에서 텍스트를 생성하는 관찰 모델을 대체하기보다 고정된 선택과 확률을 제공한다. 무엇을 검색하고 어디서 나누며 언제 기억을 가져올지를 결정하는 위치에 놓는 실험이다. 저자는 일부 활용이 아직 운영에 적합하지 않을 수 있음을 전제한다.
검색을 개선해도 기존 재정렬 모델보다 싼 것은 아니다
원문은 SciFact·NFCorpus·TREC-COVID·FiQA·SCIDOCS 등 공개 BEIR 데이터로 재정렬을 평가했다. 열거한 다섯 데이터셋에서 Jev는 초기 BM25 결과보다 nDCG@10을 0.05~0.17 높였다고 보고한다. 이 지표는 상위 검색 결과에서 관련 문서가 얼마나 높은 순위에 있는지 보는 값이다. Noul을 삭제 기준으로 쓰면 아무것도 남지 않는 실패가 있었고 확률순 정렬과 Score-10 방식은 작동했다. Jev 방식 중에서는 Score-10이 가장 좋은 결과를 냈다는 설명이다.
전용 모델과의 비교는 더 복잡하다. 공통으로 비교한 세 데이터셋 평균은 Jev 0.612와 bge-reranker-base 0.564였지만 jina-reranker-turbo의 0.633보다는 낮았다. SciFact의 본문 수치는 Jev 0.751, monoT5 0.766, RankGPT-4 0.756이다. 첨부 그래프는 Jev를 BM25 상위 100개 후보에 Score-10을 적용해 측정했으며 다른 모델의 품질은 발표된 값을 가져왔다고 명시한다. 모든 비교 대상을 동일한 환경에서 새로 실행한 결과로 이해하면 안 된다.
비용의 비교 조건도 남겨야 한다. 본문은 질의당 Jev 약 0.00037달러와 BGE 약 0.00002달러를 제시하지만 SciFact 그래프에는 Jev 측정 비용이 0.00133달러로 따로 적혀 있다. 두 수치가 왜 다른지는 본문에서 충분히 연결하지 않아 하나의 보편적인 질의 단가로 합칠 수 없다. Voyage와 비슷한 입력 토큰 단가라는 비교 역시 같은 질의 비용이나 같은 품질을 뜻하지 않는다. Shah의 결론도 지금은 전용 재정렬 모델을 유지하되 결정 모델의 발전을 계속 평가하겠다는 쪽에 가깝다.
청크 경계의 판단과 검색 결과의 품질
청킹 실험은 각 문장이 앞선 생각을 이어 가는지, 새로운 주제나 발화가 시작되는지 Jev에 묻는다. 그 판단을 목표 크기 근처의 분할 지점 선택에 사용한다. 비교 방법에는 고정 길이와 겹침, 재귀 구분자, 문장 묶기, Markdown 제목, 임베딩 기반 경계 탐지가 포함된다. 청크를 그럴듯하게 나누는지보다 나중에 질문에 필요한 정보를 잘 가져오는지가 평가의 대상이다.
첨부 그래프의 내부 평가는 Markdown·평문·노이즈 형식과 여섯 언어에 걸친 문서 36개, 질문 72개를 사용한다. 320자 청크에서 Jev continuation과 boundary는 최상위 청크의 정답 포함률인 hit@1이 모두 93%였고 재귀 구분자는 89%였다. 160자 청크에서는 boundary가 82%, continuation이 75%, 임베딩 방식이 76%였다. 별도 그림은 160자 청크를 640자 문맥 예산에 맞춰 검색한 결과로, 영어에서는 Jev boundary가 67%이고 일부 다른 방식은 100%였다. 청크 크기와 예산, 언어가 달라지면 유리한 방법도 달라진다.
비용은 문서 1천 개당 규칙 기반 0.008달러, 임베딩 의미 분할 0.011달러, Jev continuation 0.080달러, boundary 0.087달러로 보고됐다. 원문이 참고한 Chroma 연구는 관련 토큰의 재현율·정밀도·겹침 비율로 청킹을 평가하며 적절히 설정한 휴리스틱 방법도 잘 작동할 수 있다고 설명한다. 그 연구 자체가 Jev를 평가한 것은 아니다. Shah의 내부 결과를 읽을 때도 최고라는 표현보다 표본과 지표, 비용을 함께 봐야 하며 93%의 검색 성공을 완벽한 분할 정확도로 바꿔 부를 수는 없다.
문장을 덜 읽으면 기억이 달라질 수 있다
메모리 관찰 모델은 새 대화나 문서를 읽으면서 이미 저장된 사실과 새로 배울 사실을 구분해야 한다. 제목이나 음성 확인, 별다른 조치가 없다는 발언처럼 추출에 불필요해 보이는 부분도 함께 들어온다. 실험에서는 문장마다 Noul로 관찰 모델에 보낼지 결정하는 앞단 필터를 뒀다. 내부 평가에서 내용 토큰을 58% 줄였지만 이는 전체 메모리 처리 비용이나 보존 정확도가 같은 비율로 개선됐다는 뜻은 아니다.
문장별 판단은 앞뒤의 관계를 놓쳤다. 첨부 사례에서는 음식 추천 대화의 직접적인 제안이 제거되면서 뒤의 동의가 무엇을 가리키는지 해석하기 어려워진다. 법률 문서의 앞부분에 나온 정의도 당장 기억할 사실처럼 보이지 않더라도 뒤에서 참조될 수 있다. 원문은 여러 변형에서도 비슷한 문제가 남아 현재 Jev를 메모리 압축기로 쓰기 어렵다고 결론 내린다. 저렴한 전용 관찰 모델 learner-1을 이미 사용한다는 설명까지 고려하면 필터의 추가 비용과 정보 손실을 함께 평가해야 한다.
기억을 불러오는 판단을 어디에 둘 것인가
마지막 실험은 Claude Code의 UserPromptSubmit 훅에서 Jev가 기억 검색의 필요성을 판단하게 하는 방식이다. 원문은 플러그인의 평균 주입량을 약 250토큰으로 설명하지만 그 수치가 Jev 도입 전후의 효과를 비교한 것은 아니다. Shah는 주 에이전트가 기억이 필요할 시점을 스스로 고르는 데 약하다고 보고 그 판단을 하네스에 두는 접근을 선호한다. 기억을 쓰지 말라는 요청도 검색을 하지 않는 분기로 연결할 수 있다고 제안한다.
다만 게시물의 탐색 실험을 현재 배포된 플러그인의 확정 사양으로 읽을 수는 없다. 연결된 공개 문서는 매 턴 Claude가 회상의 유용성을 판단하는 reasoned recall과 대화·중요 도구 사용의 자동 저장을 설명한다. Jev가 그 경로를 이미 완전히 대체했다고 확인해 주지는 않는다. 기억 사용 거부를 모델 분류에 맡길 경우에도 오분류 가능성을 따로 점검해야 한다. 재정렬과 청킹, 정보 삭제와 검색 권한은 실패했을 때의 결과가 다르므로 하나의 저렴한 판단 모델로 묶어 같은 신뢰를 부여하지 않는 것이 이 실험에서 남는 교훈이다.
참고 자료
Dhravya Shah — Jev changes a lot in memory & context engineering