브라우저 로컬 모델로 영어 단어를 모아 추천하는 Chrome 확장 프로그램

V2EX16일 전조회 7

중국 개발자 커뮤니티 V2EX에 Chrome 확장 프로그램 하나가 공개됐다. 개발자 jtjing이 만든 이 도구는 유튜브, X, 레딧 같은 영어 사이트를 평소처럼 돌아다니면서 마주치는 단어를 자동으로 모아두고, 나중에 다시 그 단어를 만났을 때 표시를 띄워주는 방식으로 동작한다. 단순한 단어장이 아니라, 사용자의 브라우징 기록을 바탕으로 "지금 가장 먼저 외울 만한 단어"의 우선순위를 매겨 추천하는 것이 핵심이다.

구조는 철저히 로컬 우선(local-first)이다. 개발자는 브라우저에서 바로 실행되는 경량 모델을 직접 학습·증류했고, 공유 표현(shared representation) 위에 작업별 선형 예측 헤드를 여러 개 얹어 사용자 프로필링과 단어 중요도 평가를 처리한다고 설명했다. 수집 대상은 자주 쓰는 사이트 74곳 이상이며, 모든 단어를 기록하는 게 아니라 모델이 걸러낸다. 추천에는 브라우징 행동, 단어 등장 빈도, '외웠음/못 외웠음' 피드백을 함께 넣어 학습한 경량 랭킹 모델이 쓰인다.

부가 기능도 붙어 있다. 단어마다 사용자가 실제로 봤던 문장을 출처와 함께 최대 10개까지 저장해 원문으로 바로 이동할 수 있고, 유튜브 영상은 자막을 자동 추출해 로컬 모델로 인식한다. 문장 해석은 OpenRouter와 DeepSeek v4.1 flash 조합을 쓴다고 개발자는 밝혔다. 완전한 오프라인 동작이 가능하며, 백업을 원할 경우 원격 동기화를 쓸 수 있는데 이때 사용자마다 개별 SQLite 데이터베이스가 할당된다.

만들게 된 계기는 번역 도구로는 해결되지 않는 지점이었다는 설명이다. 사이트를 여는 목적은 정보 습득인데, 단어를 그때그때 수동으로 표시하는 학습 습관은 잘 붙지 않았다는 것이다. 그래서 학습을 위해 멈추지 않아도 되는 무감각 수집과, 재방문 시의 표시라는 두 가지를 축으로 삼았다.

개발자 입장에서 볼 만한 지점은 온디바이스 추론과 개인화의 결합 방식이다. 서버로 데이터를 보내지 않고 브라우저 안에서 분류·랭킹 모델을 돌리면서, 개인 피드백으로 순위를 조정하는 구조는 추천 시스템을 프라이버시 제약 아래 구현하는 한 가지 참고 사례가 된다. 개발자는 별도의 대형 모델을 테스트했지만 이 분류 모델의 정확도가 더 높았고, 로컬 실행이라 속도도 빠르다고 주장했다.

다만 검증된 성과는 아직 없다. 개발자 본인이 영어 4급 정도 수준에서 한 달가량 써보고 지인 3명에게 공유한 주관적 피드백이 전부이며, 정량적 평가는 제시되지 않았다. 글 작성 시점에 Chrome 웹스토어 심사는 아직 통과하지 못한 상태였고, 일부 사용자는 구글 로그인 과정에서 origin_mismatch 오류를 보고하기도 했다. 가격은 7일 무료 후 월 1달러 구독이며, AI 문장 해석·번역 비용 때문이라고 개발자는 설명했다.