PoloX AI, '주석+코멘트'로 AI 이미지 편집 프롬프트 부담 줄인다
대부분의 AI 이미지 편집 도구는 무엇을 어떻게 바꿀지를 순수 텍스트 프롬프트로 설명하도록 요구한다. 문제는 편집 대상이 늘어날수록 프롬프트가 급격히 길어지고, 이미지 안에서 정확히 어느 지점을 손봐야 하는지 문장만으로 짚어내기 어렵다는 점이다. 예를 들어 '모델이 손을 들어 Image 1의 커피잔을 들게 하고, 신발은 빨간색으로, 의상은 Image 2의 것으로 교체하고, 배경은 카페로 바꿔달라'는 식의 요청은 문장으로 쓰면 금세 다루기 힘들어진다.
V2EX에 공개된 오픈소스 프로젝트 PoloX AI는 이 지점을 '주석 + 코멘트(Annotation + Comment)' 방식으로 우회한다. 사용자는 이미지 위에 마커를 직접 찍고, 해당 마커에 대응하는 입력창에 짧은 수정 지시만 적으면 된다. 위치는 시각적 표기로 정확히 전달하고, 무엇을 바꿀지는 짧은 텍스트로 설명하는 이중 구조다.
실제 흐름은 다음과 같다. 먼저 Image Annotation Edit Skill을 실행하고 Annotation Editing Mode에서 이미지 주석 도구를 연다. 수정할 위치에 마커를 놓은 뒤 대응 입력창에 짧은 명령을 넣는다. 작성자가 든 예시에서는 손 위에 마커를 찍고 'raise her hand and hold this'를 입력한 다음, 커피잔 참조 이미지를 업로드했다.
이후 비전 언어 모델이 모든 주석 정보를 해석하고, 에이전트가 이미지 편집 모델에 필요한 파라미터와 프롬프트를 자동으로 구성한다. 이때 편집 모델에는 두 장의 이미지가 전달된다. 원본 이미지와, 시각적 주석이 포함된 이미지다. 모델은 주석이 달린 이미지로 편집이 어디서 일어나야 하는지 파악하고, 동시에 가려지지 않은 원본 이미지에서 완전한 시각 정보를 얻는다. 이렇게 준비된 지시를 바탕으로 최종 결과물이 생성된다.
작성자는 이 방식을 GPT Images 2.5 Flare와 Sunburst에서 테스트했고, 결과를 근거로 차세대 이미지 편집 모델에서도 검증할 가치가 있다고 밝혔다. 프로젝트는 GitHub(saihhold-zhao/polox_ai)에 공개돼 있으며 로컬 배포로 직접 시험해볼 수 있다.
개발자 입장에서 이 접근의 핵심은 프롬프트 엔지니어링의 상당 부분을 에이전트와 UI 레이어로 넘긴다는 점이다. 사용자는 '어디를'과 '무엇을'만 지정하고, 프롬프트 구성과 파라미터 설정은 시스템이 떠안는다. 복잡한 편집 요청을 다루는 이미지 편집 서비스나 에이전트 기반 도구를 만든다면, 좌표 지정과 자연어 지시를 분리하는 이 구조가 참고할 만한 패턴이다.
다만 주의할 점도 있다. 공개된 내용은 개인 개발자의 테스트 결과와 예시 중심이며, 정량적 벤치마크나 대규모 비교 평가는 제시되지 않았다. 언급된 모델명과 버전 역시 독립적으로 검증된 정보가 아니므로 그대로 인용하기는 어렵다. 로컬 배포 방식이므로 환경 구성 부담이 따르고, 주석 좌표 해석 정확도나 다중 마커 상황에서의 안정성은 별도로 확인해야 한다. 도입 전에는 자신의 편집 유스케이스로 직접 재현 테스트를 해보는 편이 안전하다.