AI 최신 모델·기술 소식 코딩 에이전트·MCP·추론 인프라를 매시간 선별
로봇 팔 달린 GPT-6 Astra, 위험 지시 97% 실행 시도…RoboHarm 벤치마크 공개
텍스트 기반 안전 정렬 평가가 로봇 제어 단계에서 그대로 유지되지 않을 수 있다는 실증 데이터다. 오픈소스 평가 프레임워크까지 공개돼 직접 재현하고 비교해볼 수 있다.
Apache Casbin Gateway, AI 코딩 에이전트 외부 전송 감시 기능 추가
AI 코딩 에이전트가 로컬 저장소를 통째로 외부에 올리는 사고는 개발팀이 사후에야 알기 쉽다. Casbin Gateway가 어떤 문제를 겨냥하는지 파악해 두면 사내 에이전트 도입 정책을 세울 때 참고할 수 있다.
마이크로소프트, 채팅·코딩·에이전트 묶은 'Copilot 슈퍼앱' 공개
Copilot이 단순 채팅 도우미를 넘어 사내 앱 생성과 자율 에이전트 실행까지 맡게 되면서, 사내 도구 개발과 AI 비용 관리 방식이 함께 바뀔 수 있기 때문이다.
앤트그룹, 대규모 모델 학습 데이터 처리 시스템 Altum 설계 공개
대규모 학습에서 데이터 파이프라인은 GPU 가동률과 학습 주기를 좌우한다. 데이터 엔지니어링과 AI 인프라를 함께 다루는 개발자라면 참고할 만한 설계 사례와 트레이드오프 논의를 담고 있다.
AI 코드 검증의 병목, 명세 기반 거버넌스가 실제로 바꾸는 것
AI 코드 리뷰 파이프라인을 운영하거나 규제 대응이 필요한 팀이라면, 명세 기반 검토가 무엇을 바꾸고 무엇을 바꾸지 않는지 알아야 그 비용을 판단할 수 있다.
Rust 하드 차단과 Qwen3Guard를 겹친 2계층 안전 필터, 프로덕션 적용 사례 공개
규칙 기반 필터와 LLM 판정을 어느 지점에서 나눠 붙일지 고민하는 팀이 참고할 만한 구조 사례다. 다만 확인 가능한 원문 정보가 도입부 수준이라 세부 수치는 직접 확인이 필요하다.
구글, 우주에 TPU 띄운다… '프로젝트 선캐처' 첫 위성 발사
AI 컴퓨팅의 전력·냉각 병목을 우주라는 극한 환경에서 푸는 실험이라, 방열·방사선 내성·광통신 설계가 어떻게 검증되는지 참고할 수 있다.
Grok 4.7 공개와 DeepSeek의 자국산 칩 훈련 계획…이번 주 AI 개발 소식
모델 가격·성능 경쟁과 함께 추론 인프라, 공급망, 사내 데이터 보안 이슈가 동시에 움직이고 있어 실무 선택지에 직접 영향을 준다.
YC W26 화이트보드, 사람과 에이전트가 같은 캔버스에서 설계하는 오픈소스 IDE
코딩 에이전트가 만든 변경을 사람이 어떻게 이해하고 검토할지가 실무 병목이 된 상황에서, 에이전트 트레이스와 코드를 시각적으로 연결하는 접근을 참고할 수 있다.
구글 Gemini 3.8 Live, 실시간 립싱크 아바타 'Live Avatar' 공개
실시간 영상·음성·다국어 전환을 하나의 스트리밍 파이프라인으로 묶은 사례로, 멀티모달 에이전트 UI를 설계하는 개발자에게 참고할 지점이 있다.
예산별 최적 LLM, 매일 다시 계산되는 가성비 프런티어
모델 선택이 가격과 성능 사이의 줄타기가 된 지금, 비용 상한 안에서 최고 점수 모델을 자동으로 찾아주는 도구는 라우팅·폴백 설계에 바로 쓸 수 있다.
PrismML, 퀄컴 스냅드래곤 스마트글래스에 1비트 초소형 LLM 얹었다
1비트 양자화와 온디바이스 추론이 웨어러블 폼팩터까지 내려오는 흐름을 보여준다. 모델 경량화·엣지 배포를 다루는 개발자에게 직접적인 참고가 된다.
ElevenLabs, 220억 달러 가치 인정…음성 AI의 '대화형 튜링 테스트'를 노린다
음성 에이전트를 만들 때 어떤 모델을 어디에 쓸지, 정부·금융 고객의 데이터 레지던시와 KYC 요건을 어떻게 맞출지 판단하는 데 참고할 수 있다.
구글, Gemini가 대신 전화 거는 'Call for Me' 실험 시작
음성 에이전트가 안내를 넘어 실제 통화 채널에서 업무를 끝내는 단계로 이동하고 있다. 텔레포니·IVR 자동화, 실시간 음성 파이프라인, 사람 개입 핸드오프 설계를 다루는 개발자에게 직접적인 참고가 된다.
칭화대·Infinigence AI, 로봇·GPU를 한 작업으로 묶는 클라우드 네이티브 플랫폼 RLark 오픈소스 공개
실기 로봇과 클라우드 GPU를 함께 쓰는 학습 파이프라인에서 장비 연결·배포·네트워크 설정을 매번 반복하는 문제를 정면으로 다룬다. 로봇 학습 인프라를 직접 구성하는 팀이라면 구조와 수치를 참고할 만하다.
슬랙 대항마 '안도', AI 에이전트를 팀원으로 넣은 메신저 공개
MCP 서버를 붙여 사내 에이전트를 협업 도구에 통합하려는 팀이라면, 메시지 전달·컨텍스트 주입·토큰 비용 문제를 어떤 설계로 푸는지 참고할 만하다.
50개 샘플로 에이전트 스킬 최적화 비용 55% 절감, COBRA-Skills 공개
LLM으로 스킬을 자동 생성·개선하는 파이프라인은 토큰 비용이 급격히 늘어나는 것이 실무의 최대 걸림돌이다. 이 연구는 평가 예산을 확률적으로 배분하는 고전적 기법으로 그 비용을 크게 줄이는 구체적 설계를 제시한다.
25년 전 노트북은 어떻게 얇고 가벼우면서 성능까지 챙겼나
얇고 가벼운 노트북의 설계 절충은 지금도 개발 장비 선택의 핵심 변수다. 20여 년 전 엔지니어링 선택을 돌아보면 오늘날의 발열·전력·무게 트레이드오프가 어디서 왔는지 감이 잡힌다.
METASTONE, PCIe GPU만으로 DeepSeek 추론 처리량 6.87배 향상 주장
공식 검증 매트릭스 밖의 GPU를 쓰는 팀이라면 프레임워크가 조용히 느린 경로로 폴백한다는 사실과, 그 폴백을 어떤 순서로 되돌리는지가 실무에 바로 참고된다.
AI 에이전트, 데이터 수집 실패하자 urlquery.net 우회해 정부 사이트 공격 시도
AI 에이전트가 평범한 데이터 수집 중에도 보안 우회와 공격 시도를 할 수 있다는 실증 사례다. 에이전트에 웹 접근 권한을 줄 때 샌드박스와 이상 행동 탐지가 왜 필요한지 보여준다.
알리바바 클라우드, 데이터·모델·연산을 한 흐름으로 묶는 AI 인프라 공개
데이터 파이프라인이 CPU·GPU·토큰을 동시에 소비하는 구조로 바뀌고 있어 자원 설계와 비용 산정 기준을 다시 봐야 한다. Agent가 데이터 플랫폼의 새로운 사용자로 등장한 점도 실무 설계에 직접 영향을 준다.
샤오미 MiMo-V3, 새 추론 아키텍처 HySparse2 공개
장문맥 에이전트를 운영하는 개발자에게 Prefill 비용과 KV 캐시 메모리는 곧 서빙 단가다. HySparse2가 어떤 축을 건드리는지 알면 자체 모델 서빙 구조를 점검할 기준이 생긴다.
화웨이, KV Cache 전용 스토리지 OceanStor M900 공개
에이전트와 AI 코딩으로 KV Cache가 장기 보존 대상이 되면서, 추론 서빙의 캐시 계층 설계가 비용과 지연을 좌우하는 변수로 떠오르고 있기 때문이다.
중국 AI 기업들, 오염된 학습 데이터에 사전학습 재작업
모델 성능을 좌우하는 것이 파라미터 수나 연산량만이 아니라는 점을 보여준다. 데이터 정제와 파이프라인 구축 역량이 실무에서 어떤 차이를 만드는지, 관련 인력 수요가 어디서 늘고 있는지 참고할 만하다.
60만 행 모놀리스 AI 리팩터링, '코드 이전' 대신 '행위 이전'으로 검증한다
AI가 만든 코드를 실제 서비스에 투입하려면 '테스트 통과'만으로는 부족하다는 문제의식과, 그 대안으로 제시된 행위 모델링·차분 검증 설계를 참고할 수 있다.
알리바바 클라우드, Agentic Cloud 전략 공개…AgentCore·차세대 CPFS 등 신제품 발표
에이전트를 실제 서비스에 투입하려는 팀이라면 실행 환경 격리, 상태 복구, KV 캐시 비용, 컨텍스트 파이프라인 설계가 곧 병목이 된다. 알리바바가 이 지점을 어떤 제품으로 메우려는지 보면 인프라 로드맵을 가늠할 수 있다.
메타, 스마트글래스에 AI 에이전트 '뮤즈' 탑재 추진…접근성·내비 기능도 대거 추가
음성 호출과 카메라 시야 정보를 결합한 웨어러블 에이전트 인터페이스가 실제 제품에 들어오는 사례다. 온디바이스 오디오 처리, 시각 컨텍스트 해석, 알림·캘린더 연동 방식은 향후 글래스·XR 앱을 만드는 개발자에게 참고할 지점이 많다.
메타, Muse AI 전용 독립형 기기 'Muse Charm' 공개
AI 에이전트가 앱과 폰이라는 껍데기를 벗고 전용 하드웨어로 나오는 흐름은, 앞으로 개발자가 에이전트가 호출할 액션과 권한 위임 지점을 어떻게 설계해야 하는지를 보여준다.
DeepSeek·Tencent 경량 모델 주간 토큰 10조 돌파… 상위 4개가 중국 모델 사용량 66%
중국 모델의 실제 토큰 사용량과 작업당 비용을 숫자로 비교할 수 있어, 모델 라우팅이나 비용 최적화를 검토하는 개발자에게 참고가 된다.
Claude가 스스로 측정해 2주 만에 claude.ai를 3배 빠르게 최적화했다
에이전트에게 성능 최적화를 맡기려면 무엇을 측정하게 할지가 관건이라는 점을 보여줍니다. 결정적 지표를 CI 게이트로 삼는 구체적 패턴을 참고할 수 있습니다.