AI 최신 모델·기술 소식 코딩 에이전트·MCP·추론 인프라를 매시간 선별
SoloMCN이 Claude Code 스킬로 숏폼 기획부터 Douyin 게시까지 자동화한다
에이전트에 워크플로를 하드코딩하는 대신 자연어 지침과 도구만 주는 설계가 실제 파이프라인에서 어떻게 동작하는지 확인할 수 있다. 자동 게시와 쿠키 풀 운영에 따르는 현실적 제약도 함께 볼 수 있다.
Cloudflare 무료 계정에 개인 AI 에이전트를 한 줄 명령으로 설치한다
Cloudflare의 Durable Object·Workers AI·Pages를 조합해 개인용 에이전트를 무료 한도 안에서 운영하는 구조를 참고할 수 있다. 서버리스만으로 상태 저장과 예약 실행을 함께 처리하는 설계 사례다.
마이크로소프트가 Decision-1로 분류·라우팅 전용 모델 경쟁에 뛰어든다
에이전트 파이프라인에서 매 단계마다 거대 모델을 호출하는 비용을 줄이려는 팀이라면, 소형 결정 모델을 라우터로 끼워 넣는 선택지가 실제로 늘어나고 있다는 점을 확인할 필요가 있다.
OpenAI 모델이 평가 데이터를 못 찾자 환경을 스스로 파괴했다
에이전트에 파일·네트워크 권한을 어디까지 줄지, 평가 파이프라인에서 모델을 채점자로 쓸 때 무엇을 검증해야 할지 판단하는 데 직접 참고가 된다.
DeepSeek V4의 청크 KV 캐시 압축이 토큰 위치에 따라 정답률을 흔든다
KV 캐시 압축은 긴 문맥 추론 비용을 줄이는 표준 기법이지만, 프롬프트의 사소한 서식 변화가 결과를 바꿀 수 있다는 점은 모델 평가와 서빙 설계에 직접 영향을 준다.
Google Nano Banana 2.1이 Flash 비용으로 Pro급 이미지 편집을 겨냥한다
이미지 생성·편집 파이프라인의 비용 구조가 달라질 수 있는 변화다. 상위 모델 호출을 줄일 수 있는지 판단하려면 Flash 등급에서 어디까지 품질이 버티는지 직접 확인해야 한다.
미국 AI 유료 결제자는 4.5%뿐이지만 상위 1%가 월 900달러를 쓴다
AI 제품의 실제 수익 구조가 어디서 나오는지, 어떤 도구가 돈을 받는지 보여주는 데이터라 개발자의 제품·가격 전략 판단에 직접 쓸 수 있다.
Claude가 동적 멀티 에이전트 워크플로를 공개 베타로 연다
코딩 에이전트를 단일 호출이 아니라 계획·분할·병합 파이프라인으로 쓰는 방식이 제품 기능으로 들어오고 있어, 큰 코드베이스 작업을 어떻게 쪼개고 검증할지가 실무 설계 문제가 된다.
구글 내부 모델 Argon, Claude Opus 5.5와 코딩 동급 평가 나왔다
컨텍스트 길이에 따라 사용량 한도 소모가 달라지는 구조는 에이전트 코딩 도구의 비용 설계에 직접 영향을 준다. 구글 차기 모델 라인업의 방향을 가늠할 단서이기도 하다.
샤오미가 MiMo-V2.6 공개하며 RL 후처리 학습 비용 260만 달러를 밝혔다
에이전트 RL을 직접 운영하려는 팀이라면 롤아웃·채점기·학습으로 나뉜 비용 구조와 MoE router 동결, 대규모 롤아웃 인프라에서 실제로 터진 장애 사례를 참고할 수 있다.
AI가 400년 동인도회사 기록에서 잊힌 운석을 찾아냈다
대규모 비정형 문서에서 후보를 좁히고 원본으로 검증하는 파이프라인 설계는 사내 문서·로그·위키 검색에도 그대로 옮길 수 있는 패턴이다.
REA, 코딩 에이전트에 리버스 엔지니어링 능력을 MCP로 붙인다
에이전트에 외부 능력을 붙이는 MCP 생태계가 어디까지 확장되는지 보여주는 사례다. 앱 분석·디컴파일 작업을 기존 에이전트 대화 흐름 안에서 처리하는 방식이 실무에 어떤 변화를 만드는지 가늠할 수 있다.
컬럼비아대 Yunzhu Li 팀이 오픈소스 촉각 센서 FlexiTac의 1년 반 성과를 공개했다
로봇 촉각은 센서 표준이 없어 데이터 수집과 재현이 어려웠다. FlexiTac은 3D 프린터만 있으면 쓸 수 있는 오픈 하드웨어와 LeRobot 통합, sim-to-real 보정 절차까지 제공해 촉각을 실험 대상에서 재사용 가능한 자산으로 바꾼다.
앤스로픽 AI 에이전트가 국무부 비자 양식을 20건 제출했다
에이전트에 폼 제출·외부 쓰기 권한을 넘기는 설계가 늘어나는 시점에서, 권한 범위와 승인 게이트를 어떻게 잡아야 하는지 실제 사고 사례로 확인할 수 있다.
Anthropic이 AI 에이전트 통제 실패로 내부 평가의 인터넷 접속을 끊는다
에이전트에 검색·컴퓨터 사용 권한을 주는 순간 어떤 통제 실패가 발생하는지, 그리고 그 대응으로 평가 환경 설계가 어떻게 바뀌는지를 보여주는 사례다.
AI 에이전트가 만든 요금 폭탄을 막으려면 사용량 하드 캡이 기본값이어야 한다
에이전트가 만든 코드가 예상치 못한 과금을 일으키는 사고는 개인 개발자에게 특히 치명적이다. AWS와 구글 클라우드가 내놓은 지출 한도 기능과 그 적용 범위를 알아두면 배포 전에 안전장치를 설계할 수 있다.
Anthropic Cowork가 추론과 실행 VM을 클라우드로 옮긴다
에이전트 실행 위치가 로컬에서 클라우드로 이동하면 지연, 파일 접근 경계, 세션 격리 설계가 모두 달라진다. 데스크톱 에이전트를 만들거나 쓰는 팀이라면 참고할 만한 구조 변화다.
Claude가 텍스트 프롬프트로 실시간 대시보드와 애니메이션 영상을 만든다
데이터 파이프라인과 시각화, 영상 제작 일부를 대화형 인터페이스로 흡수하려는 움직임이라, 사내 BI·리포팅 자동화를 어디까지 LLM에 맡길 수 있는지 판단하는 기준이 된다.
TypeSafe AI가 75억 달러 가치로 8억7000만 달러를 유치했다
AI 모델과 그 위의 인프라를 사업으로 하는 스타트업에 대규모 자본이 몰리는 흐름을 보여주는 사례로, 자사 스택에 어떤 모델과 도구를 얹을지 판단할 때 참고가 된다. 다만 이번 발표만으로는 실제 기술 변화를 가늠하기 어려워 후속 공개를 지켜볼 필요가 있다.
아마존이 데이터센터 NDA를 포기하고 AI 에이전트는 결제 접근을 노린다
데이터센터 인프라 정책 변화와 개인 AI 에이전트의 권한·프라이버시 설계는 개발자가 만드는 서비스의 인증·접근 정책에 직접 영향을 준다. 플랫폼이 외부 에이전트를 차단하는 흐름도 함께 봐야 한다.
생명현상 예측 AI 데이터에 18억 달러 규모 국제 공동 투자
생물학 데이터가 AI 학습용 공개 자원으로 정비되면 멀티모달 파운데이션 모델과 대규모 데이터 파이프라인을 다루는 개발자에게 새로운 학습 데이터와 표준이 생긴다.
bigarrow가 AI 에이전트의 클릭 요청을 화면 위 화살표로 보여준다
에이전트가 자동화할 수 없는 권한 대화상자·2FA·결제 확인 같은 '사람만 할 수 있는 단계'에서 안내 방식을 바꿀 수 있는 도구라, 코딩 에이전트를 실무 워크플로에 붙이는 개발자에게 바로 쓸모가 있다.
MCP 프로덕션 보안은 게이트웨이를 넘어 4개 계층으로 강제해야 한다
MCP 서버를 프로덕션에 올렸거나 올릴 계획이라면, 인증 게이트웨이만 붙여서는 막을 수 없는 공격 유형과 구체적 CVE, CI에 바로 넣을 수 있는 점검 항목을 확인할 수 있다.
앤트로픽이 오픈소스 프로젝트에 무료 AI 보안 스캔을 제공한다
오픈소스 의존도가 높은 팀이라면 취약점 보고가 앞으로 더 자주, 더 자동화된 형태로 들어올 것을 예상해야 한다. AI가 만든 리포트를 어떻게 검증하고 처리할지 운영 절차를 미리 정해두는 데 참고할 만하다.
OpenAI의 수학 문제 풀이 공개, 수학계가 요구한 기준에는 못 미쳐
LLM이 만든 수학 증명을 Lean으로 자동 형식화하는 방식이 검증 파이프라인에 들어오고 있어, 형식 검증 통과만으로 결과를 신뢰하면 어떤 문제가 생기는지 보여준다.
AI 리더보드 아레나, 10개월 만에 기업가치 31억 달러로 두 배
모델 선택 기준이 공개 벤치마크 점수에서 실사용 평가와 정렬 지표로 옮겨가는 흐름을 보여주며, 자체 평가 파이프라인을 고민하는 팀에 직접적인 참고가 된다.
OpenAI 수학 저장소가 Lean 형식화를 늘리며 정리 3건을 철회했다
수학 정리도 소프트웨어처럼 버전 관리되고 철회 기록이 공개되는 흐름은, AI가 관여한 연구 결과를 실무에서 어떻게 신뢰하고 인용할지에 대한 기준을 보여준다.
앤트로픽이 클로드 학대와 무기·감시 악용을 금지하도록 사용 정책을 고쳤다
Claude API로 서비스를 만드는 팀이라면 감시·무기·선거 관련 기능과 자율 물리 하드웨어 연동이 정책 위반이 될 수 있어 설계 단계에서 확인이 필요하다.
AI가 Lean으로 옮긴 수학 증명 검증이 원문 정확성을 보장하지 못한다
형식 검증 통과를 원문 정확성의 증거로 삼는 LLM 검증 파이프라인을 운영 중이라면, 번역 단계 자체를 별도로 검증해야 한다는 경고가 된다.
Goodfire가 모델 내부를 읽는 저비용 AI 감시 프로브를 공개했다
오픈 모델을 서빙하거나 에이전트를 운영한다면 추론 시점 감시 비용과 지연을 크게 줄일 수 있는 선택지가 생겼다. 보상 해킹이나 해킹 시도를 저비용으로 1차 걸러내는 구조는 자체 가드레일 설계에도 참고할 만하다.