Web Agent를 실제 브라우저에서 돌려보면 자주 부딪히는 문제가 있습니다.
그건 바로 CAPTCHA입니다.
최신 AI 모델은 CAPTCHA를 통과하는 작업을 보안상의 이유로 꺼리는 경우가 많습니다. 그렇기에 CAPTCHA 하나 때문에 웹 자동화 전체가 막힐 수 있습니다.
이번에 업데이트한 browser-rs-mcp에는 이 문제를 다루기 위한 간단한 아이디어가 들어갔습니다.
CAPTCHA를 모델에게 그대로 보여주지 않는 것입니다.
웹페이지에서 Agent에게 반환되는 텍스트 중 CAPTCHA와 관련된 표현을 다른 단어로 바꿉니다.
예를 들면 다음과 같습니다.
CAPTCHA → challenge Verify you are human → Complete the check I'm not a robot → Continue here Validation successful → Result complete verify-img-out → widget-img-out이렇게 하면 모델은 CAPTCHA의 원래 표현을 직접 보지 않고, 변환된 정보를 기반으로 페이지를 이해하고 다음 행동을 판단할 수 있습니다.
여기까지 오면 절반은 해결한 셈입니다.
그런데 곧바로 다른 문제가 생깁니다.
CAPTCHA와 관련된 텍스트뿐 아니라 DOM의 class, id, attribute까지 변환하기 때문입니다. Agent가 변환된 class나 id를 사용해 selector를 만들면, 실제 페이지에는 해당 selector를 가진 element가 존재하지 않습니다.
그래서 Agent에서 브라우저로 들어가는 selector, id, JavaScript, 입력값은 실행 직전에 다시 원래 표현으로 되돌립니다.
브라우저 → Agent #verify-img-out → #ax0f20-widget-img-out Agent → 브라우저 #ax0f20-widget-img-out → #verify-img-out즉, Agent가 보는 세계와 실제 브라우저가 실행하는 세계를 서로 격리해 문제를 해결하는 방식입니다.
이 접근의 핵심은 다음 두 가지입니다.
- AI가 민감할 수 있는 CAPTCHA 신호를 안전한 표현으로 인식하게 합니다.
- 실제 브라우저 조작이 필요한 순간에는 입력 경계에서만 원래 표현으로 되돌립니다.

7 hours ago
5
![[속보] 네팔 홍수로 고립됐던 한국인 10명 중 9명 안전지역 이송](https://amuse.peoplentools.com/site/assets/img/broken.gif)








English (US) ·