구글과 앤스로픽, ReAct 에이전트가 클라우드 예산을 고갈시킬 수 있다고 경고
ReAct 루프는 모델이 스스로 단계를 결정할 수 있게 해주지만, 각 '사고-행동-관찰(Thought-Action-Observation)' 사이클마다 추가적인 추론 비용이 발생합니다. 이는 지연 시간을 누적시킬 뿐만 아니라, 단 한 번의 오독이 전체 작업을 실패로 몰아넣을 위험을 높입니다.
AI, 머신러닝 및 LLM 인사이트.
ReAct 루프는 모델이 스스로 단계를 결정할 수 있게 해주지만, 각 '사고-행동-관찰(Thought-Action-Observation)' 사이클마다 추가적인 추론 비용이 발생합니다. 이는 지연 시간을 누적시킬 뿐만 아니라, 단 한 번의 오독이 전체 작업을 실패로 몰아넣을 위험을 높입니다.
스웜(Swarm)은 단일 감독관 대신 서로를 지속적으로 검토하는 동료 에이전트들의 수평적 네트워크를 활용하지만, 모든 상호작용이 별도의 모델 호출을 유발하여 컴퓨팅 비용과 지연 시간을 급격히 증가시킵니다.
에이전트는 쿼리를 재작성하고 검색 필요 여부를 결정하며, 복잡한 질문을 하위 단계로 나누고 근거가 부족할 경우 스스로 수정합니다. 또한 모든 주장에 대해 인용을 제공함으로써 토큰 사용량을 획기적으로 절감합니다.
이 선택형 서비스는 Jumio를 통한 까다로운 셀카 및 신분증 인증 절차를 마친 소수의 미국 크리에이터들에게, AI가 사용자의 인증된 얼굴 특징과 일치한다고 판단한 영상이나 이미지를 확인할 수 있는 대시보드를 제공합니다.
URL 조회를 콘텐츠 주소 지정 해시(content-addressed hashes)로 대체함으로써, COS API는 어떤 사이트든 이미 SHA-256 값을 알고 있는 파일을 요청할 수 있게 하여 브라우저가 동일한 33GB AI 모델을 다시 다운로드하지 않고도 여러 오리진에 제공할 수 있도록 합니다.
The revamped workflow scrapes queries with >500 impressions, <50 clicks, <1% CTR and position >20, then uses Llama 3 for headlines and Claude 3.5 Sonnet for full drafts, keeping each article under five cents while delivering a 15% lift in organic impressions.
모델이 거짓말을 하기 전에 평가 하네스가 먼저 당신을 속일 것입니다. 평가 스코어보드에 따르면 두 엔진 모두 실패했습니다. Llama3.2는 6개 사례 중 5개에서 실패했고, Anthropic Sonnet은 6개 사례 모두 실패했습니다...
새로운 아키텍처는 수천 개의 아미노산 사슬 전체를 단 한 번의 패스로 처리하여 장거리 상호작용을 보존하는 동시에, 방대한 서열 코퍼스 학습을 더욱 빠르고 저렴하게 만듭니다.
새로운 x402 프로토콜은 각 HTTP 요청에 결제 토큰을 포함하여, AI 에이전트가 데이터, 컴퓨팅 또는 API 호출에 대한 비용을 자동으로 차감할 수 있도록 합니다. AgentCore Payments로 불리는 AWS Bedrock 통합 기능은 원활한 머신 커머스를 위해 내장 지갑과 지출 한도 설정 기능을 제공합니다.
WebMCP는 취약한 DOM 스크래핑 방식 대신, React 컴포넌트가 마운트 시점에 등록하는 타입화된 도구 호출 매니페스트를 사용하여 Chrome 149 이상 버전의 AI 에이전트에게 레이아웃에 구애받지 않는 즉각적인 상호작용을 제공합니다.
Sequoia, Felicis, Optum Ventures 및 Y Combinator의 지원을 받는 Bunkerhill은 EHR 데이터를 추출하고 검사를 주문하며 케어 플랜을 업데이트할 수 있는 소프트웨어인 Carebricks 에이전트의 파일럿 도입을 계획하고 있으며, 이를 통해 임상의의 일상적인 조정 업무 부담을 완화하는 것을 목표로 합니다.
SEED 프레임워크는 에이전트가 자신의 트랜스크립트를 읽고 자연어 형태의 교훈을 작성한 뒤, 이를 정책 업데이트로 정제하는 에피소드 종료 후 단계(post-episode pass)를 추가하여, 희소한 보상 신호를 풍부하고 재사용 가능한 훈련 신호로 전환합니다.
2026년 7월 28일 출시되는 MCP 버전 2는 초기화 핸드셰이크, Mcp-Session-Id 헤더 및 3개의 레거시 서브시스템을 제거하여 프로토콜을 완전히 상태 비저장(stateless) 방식으로 만듭니다. 이제 팀은 세션 어피니티(session-affinity) 제약 없이 오토스케일링 또는 서버리스 포드에서 실행할 수 있습니다.
Inferentia2 INF2.24xlarge는 CPU 레퍼런스와 정확히 일치하는 토큰 스트림을 재현했으나, 두 실행 모두 채팅 템플릿과 턴 마커가 누락된 잘못된 프롬프트가 입력되어 Gemma-4가 무의미한 말을 반복하는 무한 루프에 빠졌습니다. 하드웨어는 단지 레퍼런스 코드의 버그를 그대로 재현했을 뿐입니다.
모델명, 토큰 수, 작업 유형 및 호출당 비용을 기록하는 PostgreSQL 로깅 레이어를 추가함으로써, 연구자는 가공되지 않은 SEC 검색 결과가 프롬프트 크기를 부풀리고 있다는 점을 파악했습니다. 해당 결과를 요약하고 간단한 확인 작업은 더 저렴한 모델로 라우팅함으로써 31%의 비용 절감을 달성하고 정확도 또한 향상시켰습니다.
이번 대출은 SambaNova의 SN50 추론 칩을 담보로 활용하며, 이는 기존 GPU 팜 대비 최대 16배 빠른 토큰 처리 속도, 낮은 전력 소모 및 간편한 냉각 방식을 보장하는 최초의 자산 클래스입니다.
토발즈는 메일링 리스트를 통해 새로운 Sashiko 리뷰어와 같은 AI 도구에 반대하는 사람은 누구나 단순히 커널을 포크하면 된다고 말하며, 기술적 가치가 이념적 저항보다 중요하다는 자신의 견해를 강조했습니다.
이 저장소는 CLI, 터미널 UI 및 런타임을 위한 Rust 소스를 제공하여 컨텍스트 구성 방식, 도구 오케스트레이션 및 편집 관리 방식을 검토할 수 있게 하며, 워크플로를 중단하지 않고도 기반 모델을 교체할 수 있습니다.
2.8조 개의 파라미터를 가진 Moonshot AI의 오픈 웨이트 모델 Kimi K3가 실무형 AA-Briefcase 벤치마크에서 GPT-5.6보다 높은 점수를 기록했습니다. 현재 API를 통해 이용 가능하며, 모델 가중치는 7월 27일에 공개될 예정입니다.
최신 버전에는 작업 오케스트레이션, 승인 워크플로우, 테스트 리그, UI 인식 브라우징 기능이 추가되었습니다. 이를 통해 AI는 단일 콘솔에서 티켓을 선택하고, 자율 에이전트를 실행하며, 사람의 승인을 받고, 시각적 프리뷰를 배포하는 모든 과정을 수행할 수 있습니다.
미국 기반 개발자에게만 제공되는 이 서비스는 입력 토큰 100만 개당 $1.25, 출력 토큰 100만 개당 $4.25를 청구하며, 신규 계정에는 $20의 크레딧을 제공하고 해외 사용자를 위한 대기 명단을 운영합니다.
의사를 예측하는 법을 배운 패혈증 모델: 2021년, 미시간 메디신은 Epic 패혈증 모델을 테스트했습니다. 38,455건의 입원 사례를 조사한 결과, Epic은 정확도가 높다고 주장했으나...
PrismML’s Bonsai 27B shrinks from a 54.7 GB full-precision model to a 3.9 GB 1-bit file, fitting on a flagship iPhone while retaining 89.5% of its quality. The claim relies on Apple’s MLX stack and delivers about 11 tokens per second, but memory, heat and battery impacts remain unmeasured.
OpenAI의 내부 GPT-Red 모델이 GPT-5.6 Sol 라인의 실패율을 6분의 1로 낮췄으나, 연구 논문은 이론만 제공할 뿐 다운로드 가능한 테스트 프레임워크를 제공하지 않아 소규모 팀들이 직접 결정론적 테스트를 구축해야 하는 상황입니다.