skills

AI Agent FrameworksskillPython

★ 5,938주당 +68조회 4

무엇인가

BrowserAct Skills는 AI 코딩 에이전트에 실제 브라우저를 조작하는 명령 체계와 상태 조회 절차를 주입하는 스킬 팩이다. 규율하는 문제 영역은 보호된 웹 페이지 접근, 웹 데이터 추출, 로그인 상태를 쓰는 계정 기반 워크플로 실행이다. 에이전트가 DOM을 파싱하거나 스크래핑 스크립트를 직접 작성하지 않고도 브라우저 상태를 읽고 조작하도록 규칙을 고정한다.

어떻게 동작하나

배포 형식은 SKILL.md 계열 규칙 파일이며, 에이전트는 세션 시작 시 `browser-act get-skills core --skill-version 2.0.2`를 호출해 환경 상태·브라우저 목록·사용 가능 명령을 한 번에 받는다. 상호작용은 `state`가 반환하는 인덱스 목록을 기준으로 `click 3`, `input 2 "..."`처럼 인덱스로 지정한다. 세션은 `--session` 이름으로 소유권을 명시해 다중 에이전트 충돌을 막고, 브라우저 생성·삭제, Profile 가져오기, 프록시 변경, 보안·프라이버시 토글은 사용자 승인 없이는 실행되지 않도록 확인 게이트를 건다. 승인은 다음 호출로 이월되지 않는다.

무엇과 다른가

프롬프트에 스크래핑 절차를 직접 적어 넣는 방식은 세션마다 지시를 다시 주입해야 하고 세션·프록시·핑거프린트 상태를 추적하지 못한다. BrowserAct Skills는 명령 계층과 상태 조회를 스킬 쪽에 두고 에이전트는 인덱스와 세션 이름만 다루게 한다. 출력도 JSON·HTML 대신 인덱스 텍스트 형식을 쓰고, 브라우저마다 `desc`를 붙여 작업 의미로 매칭한다. 안티봇 대응은 환경 계층(스텔스 핑거프린트·TLS 로테이션·프록시 전환), 실행 계층(`solve-captcha`·`stealth-extract`), 사람 계층(`remote-assist`가 생성한 URL로 사용자가 인계)의 3단으로 나뉜다.

어떻게 쓰나

설치는 README가 제시하는 방식대로 에이전트에게 "Install browser-act. Skill source: https://github.com/browser-act/skills/tree/main/browser-act . Verify it works after installation."를 전달해 스킬 소스를 로드시키는 것이다. 첫 사용은 `browser-act stealth-extract https://example.com`으로 보호된 페이지를 뽑거나, `browser-act --session my-task browser open https://example.com` → `state` → `click 3` 순으로 진행한다. 클라우드 실행 모드는 에이전트 설정 없이 동작하고, 로컬 Skills 경로는 로컬 Chrome 로그인 상태 재사용과 자체 에이전트 워크플로 통합에 쓴다.

전제와 한계

Windows·macOS·Linux에서 동작하며 셸 명령 실행과 스킬 로드가 가능한 에이전트(Claude Code, Cursor, VS Code, OpenCode, OpenClaw, Codex, Gemini CLI)에서 쓴다. 관리형 프록시(Dynamic·Static)와 6번째 이후 스텔스 브라우저는 유료이고 나머지 기능은 무료다. 확인 게이트는 설정 토글이 아니라 스킬 계층에서 강제되므로 우회할 수 없다.

유사 도구