AI 최신 모델·기술 소식 코딩 에이전트·MCP·추론 인프라를 매시간 선별
샤오미 MiMo-V3, 새 추론 아키텍처 HySparse2 공개
장문맥 에이전트를 운영하는 개발자에게 Prefill 비용과 KV 캐시 메모리는 곧 서빙 단가다. HySparse2가 어떤 축을 건드리는지 알면 자체 모델 서빙 구조를 점검할 기준이 생긴다.
화웨이, KV Cache 전용 스토리지 OceanStor M900 공개
에이전트와 AI 코딩으로 KV Cache가 장기 보존 대상이 되면서, 추론 서빙의 캐시 계층 설계가 비용과 지연을 좌우하는 변수로 떠오르고 있기 때문이다.
중국 AI 기업들, 오염된 학습 데이터에 사전학습 재작업
모델 성능을 좌우하는 것이 파라미터 수나 연산량만이 아니라는 점을 보여준다. 데이터 정제와 파이프라인 구축 역량이 실무에서 어떤 차이를 만드는지, 관련 인력 수요가 어디서 늘고 있는지 참고할 만하다.
60만 행 모놀리스 AI 리팩터링, '코드 이전' 대신 '행위 이전'으로 검증한다
AI가 만든 코드를 실제 서비스에 투입하려면 '테스트 통과'만으로는 부족하다는 문제의식과, 그 대안으로 제시된 행위 모델링·차분 검증 설계를 참고할 수 있다.
알리바바 클라우드, Agentic Cloud 전략 공개…AgentCore·차세대 CPFS 등 신제품 발표
에이전트를 실제 서비스에 투입하려는 팀이라면 실행 환경 격리, 상태 복구, KV 캐시 비용, 컨텍스트 파이프라인 설계가 곧 병목이 된다. 알리바바가 이 지점을 어떤 제품으로 메우려는지 보면 인프라 로드맵을 가늠할 수 있다.
메타, 스마트글래스에 AI 에이전트 '뮤즈' 탑재 추진…접근성·내비 기능도 대거 추가
음성 호출과 카메라 시야 정보를 결합한 웨어러블 에이전트 인터페이스가 실제 제품에 들어오는 사례다. 온디바이스 오디오 처리, 시각 컨텍스트 해석, 알림·캘린더 연동 방식은 향후 글래스·XR 앱을 만드는 개발자에게 참고할 지점이 많다.
메타, Muse AI 전용 독립형 기기 'Muse Charm' 공개
AI 에이전트가 앱과 폰이라는 껍데기를 벗고 전용 하드웨어로 나오는 흐름은, 앞으로 개발자가 에이전트가 호출할 액션과 권한 위임 지점을 어떻게 설계해야 하는지를 보여준다.
DeepSeek·Tencent 경량 모델 주간 토큰 10조 돌파… 상위 4개가 중국 모델 사용량 66%
중국 모델의 실제 토큰 사용량과 작업당 비용을 숫자로 비교할 수 있어, 모델 라우팅이나 비용 최적화를 검토하는 개발자에게 참고가 된다.
Claude가 스스로 측정해 2주 만에 claude.ai를 3배 빠르게 최적화했다
에이전트에게 성능 최적화를 맡기려면 무엇을 측정하게 할지가 관건이라는 점을 보여줍니다. 결정적 지표를 CI 게이트로 삼는 구체적 패턴을 참고할 수 있습니다.
메타, AI 에이전트 '뮤즈'에 전용 이메일·화상통화·PC 제어까지 붙인다
에이전트가 채팅창을 벗어나 이메일·데스크톱·실시간 영상으로 접점을 넓히는 흐름은 자동화 파이프라인과 음성·영상 통합을 다루는 개발자에게 직접적인 설계 변화를 예고한다.
에이전트에 DB 붙이기, 데모는 되지만 운영은 왜 어려운가
에이전트에 DB를 물리는 일이 MCP 덕에 쉬워진 만큼, 데모 코드를 그대로 운영에 올렸을 때 생기는 보안·정확도 문제를 미리 알아둘 필요가 있다.
AI로 급하게 쌓아 올린 사내 시스템, '고칠까 다시 쓸까' 고민 커져
AI가 만든 코드를 리뷰 없이 방치했을 때 어떤 비용이 쌓이는지, 그리고 재작성을 판단하는 기준과 문서화·테스트 전략을 한 번에 볼 수 있다.
Stripe, 사내 지식 계층을 다루는 Knowledge AI Platform 공개
결제 인프라 위에서 지식 기반 AI를 어떻게 운영하는지는 사내 문서·API 정보를 AI에 연결하려는 모든 팀의 공통 과제다. Stripe의 접근 방식과 최근 에이전트 행보를 한 번에 볼 수 있다.
구글, Gemini 3.8 Flash TTS 공개…자연어로 목소리 설계하고 대사 단위로 연출한다
음성 합성이 단순 TTS API 호출에서 프롬프트 기반 보이스 설계·연출 계층으로 옮겨가는 흐름을 보여준다. 오디오북·팟캐스트·실시간 보이스 에이전트를 만드는 개발자라면 모델 선택지와 안전 요건이 함께 바뀐다.
Doubao Work, '목표 모드'·'계획 모드' 추가…작업 통제력 강화
에이전트가 '먼저 계획을 세우고 승인받은 뒤 실행한다'는 패턴은 이미 여러 코딩 에이전트가 채택한 설계다. 豆包 워크가 이를 제품 기본 모드로 끌어올린 방식은 자체 에이전트 워크플로 설계에 참고할 만하다.
Vercel이 '최고 속도 채택'이라 부른 Jev, 아키텍처엔 해자 없다는 지적
모델 채택 속도와 기술적 해자를 혼동하면 안 되는 이유를 짚어준다. 아키텍처가 복제 가능할 때 무엇이 실제 차별점인지 판단하는 기준을 얻을 수 있다.
ChatGPT 모바일 앱에 음성 에이전트 기능 탑재, 말로 문서·이메일 작업 지시한다
음성이 에이전트 워크플로의 새 진입점이 되면서, 모바일에서 트리거된 작업을 비동기로 처리하고 데스크톱으로 세션을 넘기는 구조가 필요해졌다. ChatGPT 플러그인·연결 앱 연동 범위가 무료 티어까지 넓어지는 흐름도 통합 개발 방향에 영향을 준다.
앤스로픽, 클로드 에이전트 950개로 박테리오파지 효소 시스템 발견
대규모 에이전트를 장시간 자율 탐색에 투입해 대용량 데이터에서 패턴을 건져내는 실행 구조는 생물정보에 국한되지 않는 파이프라인 설계 사례다. 토큰 예산과 오케스트레이션 규모를 가늠해볼 수 있다.
GPT-6 Astra, 채팅 한 번으로 차량 주행 과제 수행… 3회 시도 벤치마크 공개
에이전트가 연속된 물리 환경에서 명령을 내리고 실패를 누적시키는 과제를 어떻게 평가하는지, 그리고 비용·호출 효율이 왜 리더보드 1급 지표가 되는지를 보여주기 때문이다.
구글 딥마인드, 클라우드에 '기기급 프라이버시' 영구 메모리 얹는다
클라우드 AI에 상태를 유지시키면서 프라이버시를 지키는 아키텍처 패턴이 구체적으로 제시된다. 보안 엔클레이브·기기 파생 키·서버 소프트웨어 검증을 다루는 설계라, 개인화 기능을 만드는 개발자에게 참고할 지점이 많다.
Leapmotor, 텐센트 WorkBuddy로 40여 개 업무 시스템 직접 구축…개발 공수 90% 절감
AI 코딩 에이전트가 실험실을 벗어나 제조 현장의 사내 시스템 개발을 대체하는 사례라, 개발자의 역할이 어디로 이동하는지 가늠할 수 있다.
Jev와 Decitron은 둘 다 결정 AI지만 같은 게 아니다
AI 출력이 텍스트를 넘어 실행 가능한 판단이 되는 흐름은 에이전트 라우팅과 출력 스키마 설계에 직접 영향을 준다.
화웨이의 '슈퍼노드' 구상은 4096장 가속기를 한 대의 컴퓨터로 묶는다
가속기 개수를 늘리는 것만으로 학습·추론 효율이 오르지 않는 이유와, 노드 간 연결 방식이 병목이 되는 지점을 이해하는 데 도움이 된다.
Ema, 7700만 달러 조달…기업용 SaaS와 IT 서비스 예산을 노리는 AI 에이전트 팀
에이전트 오케스트레이션 레이어가 기존 SaaS와 SI 예산을 어떻게 잠식하는지, 그리고 좌석 기반 과금 모델이 어디서 흔들리는지를 보여주는 사례다.
Zhipu, AI 코딩 도구 ZCode 전면 오픈소스화…남은 세 가지 질문
코딩 에이전트가 코드베이스 전체와 셸 권한을 쥔 시대에, 어떤 데이터가 로컬을 떠나는지 판단하는 기준을 이 사례에서 얻을 수 있다.
DeepSeek, Agent 훈련 인프라 DSec 논문 공개…Liang Wenfeng 이름 올려
에이전트를 학습시킬 때 병목이 모델이 아니라 실행 환경이라는 점, 그리고 그 환경을 어떻게 격리하고 관리해야 하는지에 대한 실제 운영 수치를 볼 수 있다.
알리바바, AI폰용 풀스택 솔루션 'Qwen Intelligence' 공개…시스템급 Agent Harness 내장
온디바이스 에이전트 성능이 모델 자체보다 이를 감싸는 실행 구조(harness)에서 갈린다는 설계 관점을 보여주기 때문이다.
센스타임, 이기종 칩으로 추론 자원 재배치…일일 토큰 0.46조→4.5조
Prefill/Decode 분리 서빙과 KV 캐시 핸드오프, 이기종 스케줄링은 추론 인프라를 직접 운영하는 팀이 곧 마주칠 설계 문제다. 대규모 서비스에서 어떤 계층을 추상화하고 있는지 참고할 만하다.
GPT가 갑자기 멍청해졌다는 개발자들…계정 플래그 논란 또 불붙어
모델 품질 변동과 계정 제재는 API·구독에 의존하는 워크플로에서 곧 서비스 리스크다. 커뮤니티에서 어떤 증상이 반복 제기되는지 감을 잡아두면 폴백 설계와 모니터링 기준을 세우는 데 도움이 된다.
Pinterest, 수백억 벡터 검색에 양자화 도입…HNSW 메모리 부담 낮춘다
벡터 검색 인덱스의 메모리와 비용 트레이드오프를 실제 수치로 보여주는 사례다. 대규모 ANN 서비스를 운영하거나 양자화·SSD 서빙 도입을 검토하는 팀이 참고할 만하다.