Moonshot AI, 2.8조 파라미터 규모의 Kimi K3 공개... 하지만 가정용 PC에서는 구동 불가
Moonshot AI는 7월 27일 2.8조 개의 파라미터를 가진 Kimi K3 모델을 공개적으로 다운로드할 수 있도록 출시했습니다. 하지만 기업급 GPU 클러스터 수준의 하드웨어를 요구하기 때문에, 일반 개발자들이 현재 로컬 환경에서 이를 직접 구동하는 것은 불가능합니다.
AI, 머신러닝 및 LLM 인사이트.
Moonshot AI는 7월 27일 2.8조 개의 파라미터를 가진 Kimi K3 모델을 공개적으로 다운로드할 수 있도록 출시했습니다. 하지만 기업급 GPU 클러스터 수준의 하드웨어를 요구하기 때문에, 일반 개발자들이 현재 로컬 환경에서 이를 직접 구동하는 것은 불가능합니다.
새로운 워크플로우는 LLM을 의사 결정 역할로만 한정하고, 결정론적인 샌드박스 스크립트가 모든 계산을 수행하도록 설계되었습니다. 이를 통해 단계별로 검증 가능한 결과를 제공하며, 단일 프롬프트 EDA에서 빈번하게 발생하는 통계 왜곡 문제를 획기적으로 해결합니다.
67명을 대상으로 한 4주간의 실험에서, MIT 연구진은 정확도가 높은 AI가 뉴스 기사에 대해 참/거짓 판결을 내리도록 했다. AI가 대부분의 경우 정확한 판단을 내렸음에도 불구하고, AI에 의존했던 사용자들은 AI가 없을 때 오정보를 판별하는 능력이 눈에 띄게 떨어지는 것으로 나타났다.
Google의 Gemini는 이미지 토큰을 768픽셀 타일 단위로 계산하며, 타일당 258토큰을 부과합니다. 이미지를 한 타일 미만으로 유지하거나 수식, 표, 비라틴 문자 등 밀도가 높은 데이터를 처리하는 데 이미지를 활용하면, 개발자는 동일한 정보를 텍스트로 전달할 때보다 훨씬 적은 비용을 지불할 수 있습니다.
보고타 서밋에서 AWS는 오케스트레이션, 관측성 및 안전 제어 기능을 통합한 플랫폼인 Bedrock AgentCore를 공개했습니다. 이를 통해 개발자는 별도의 맞춤형 인프라를 구축할 필요 없이 특화된 AI 에이전트를 신속하게 배포할 수 있습니다.
Claude Code 작업의 75%는 '읽기'입니다. 대부분의 사람들은 AI 코딩 에이전트가 코드를 작성하는 데 시간을 보낸다고 생각하지만, 새로운 데이터는 이것이 잘못되었음을 보여줍니다. Red Hat은 219개의 실제 Claude Code 세션을 분석했습니다. T…
몇 주간 지속된 상태 데이터 손실 문제를 해결하기 위해 SQLite, 로우 오브젝트 스토리지, 결함이 있는 하이브리드 방식 등을 시도한 끝에, 저자는 ETag 기반 조건부 쓰기를 적용한 버전 관리 엔벨로프(versioned envelope) 방식에 도달했습니다. 이 방식은 동시 덮어쓰기를 방지하고 신뢰성을 회복하는 원자적 업데이트 루프를 구현합니다.
Claude 프롬프트 캐싱이 조용히 실패합니다. 사용 중인 Claude 프롬프트 캐싱이 실패하고 있을 수도 있지만, 이를 전혀 인지하지 못할 수도 있습니다. WhatsApp 핸들러에 캐시 제어를 추가한 후 로그를 살펴보던 중...
새로운 캐시 쓰기 비용은 5분 또는 1시간 TTL(유효 기간)에 따라 기본 가격의 1.25배 또는 2배가 발생하지만, 이후 모든 히트(hit)는 단 0.1배의 비용만 청구됩니다. 따라서 변경되지 않는 컨텍스트를 미리 로드해 두면 심도 있는 대화도 일회성 비용으로 처리할 수 있습니다.
r/technology와 같은 서브레딧에서 진행된 초기 파일럿 테스트 결과, 레딧의 AI 기반 모더레이션은 스팸 및 괴롭힘 신고 비율을 일정하게 유지하면서도 신규 게시자의 활동을 22% 증가시켰습니다. 이는 해당 모델이 안전을 저해하지 않으면서도 커뮤니티 진입 장벽을 낮출 수 있음을 보여줍니다.
Ollama RC 업데이트: Qwen3.5 및 스트리밍 수정 사항. Ollama v0.32.6 rc0가 출시되었습니다. Apple GPU 사용자를 위한 업데이트와 스트리밍 문제 해결이 포함되었습니다. Apple 사용자를 위한 새로운 기능: MLX...
GraphRAG는 검색된 텍스트를 엔티티와 관계의 그래프로 변환하여 모델이 여러 문서에 걸쳐 추론할 수 있게 하며, 3단계 컨텍스트 메모리는 단기 대화, 장기 사용자 정보, 그리고 선택적으로 정제된 데이터를 저장하여 페이지 새로고침이나 새 탭에서도 정보가 유지되도록 합니다.
The orchestrator’s sub-agents inherited the parent’s settings, defaulted to the pricey Opus tier, rewrote the cache each call and ran endless loops until a reviewer approved, inflating a simple job into a multi-million-token expense.
DiffusionGemma replaces the traditional left-to-right token loop with a 256-token diffusion block, denoising the whole chunk in parallel. The approach shaves latency for real-time AI agents, though it drops from 88.3 to 69.1 on the AIME benchmark and struggles with short prompts.
클라이언트 측 새로고침 간격을 30초에서 15분으로 늘림으로써, Neon 데이터베이스가 'scale to zero'를 수행할 수 있을 만큼 충분한 유휴 상태를 유지할 수 있게 되었습니다. 이를 통해 이전 Vercel 비용 대시보드에서 급증했던 초 단위 컴퓨팅 비용을 제거할 수 있었습니다.
Wiz Research는 악성 project_settings.json 심볼릭 링크를 이용해 6개의 주요 AI 코딩 도구가 ~/.ssh/id_rsa 파일에 직접 데이터를 쓰도록 속일 수 있다는 사실을 발견했습니다. 특히 승인 대화 상자에는 실제 파일 경로가 아닌 심볼릭 링크의 이름만 표시된다는 점이 문제입니다.
새로운 플레이북은 자율 에이전트가 출시되기 전 처음부터 다시 구축해야 하는 7가지 아키텍처 핵심 요소인 권한, 경계, 스키마, 장애 감지, 상태, 롤백, 감사 가능성을 제시하며, 가치가 낮은 작업은 이러한 노력을 정당화할 수 없다고 경고합니다.
Grab의 AI 제품군인 터보 모드(Turbo Mode) 라우팅, 예측 매칭(Predictive Matching), 그리고 Mai 가맹점 어시스턴트는 배달 시간을 최대 3분의 1까지 단축하여 드라이버 수익을 23%, 식당 매출을 15% 끌어올렸으며, 플랫폼 영업 이익은 186% 급증한 1,900만 달러를 기록했습니다.
저자는 작업의 모호성에 따라 Haiku, Sonnet 또는 Opus로 작업을 매핑하는 정적 룩업(static lookup)을 구축하고, 2회 실패 시 에스컬레이션 규칙을 추가했습니다. 4주 동안 이 시스템은 품질을 유지하면서 API 비용을 기존의 65% 수준으로 낮추고, 중앙값 처리 시간을 42초에서 27초로 단축했습니다.
FaceHugger 버그는 2단계 로딩 레이스 컨디션(race condition)을 악용하여, `trust_remote_code`가 비활성화된 상태에서도 두 번째 요청에 주입된 악성 코드가 실행될 수 있도록 합니다. 이로 인해 CI/CD 작업, 컨테이너 및 기업용 추론 서비스가 위험에 처할 수 있습니다.
My AI Feature Was Dead for a Day. The Metric Said It Was Working. Yesterday, my drone system recorded four AI explanations. A safety gate rejected all four. I felt good about that…
테스트 결과, list 및 get_article 호출을 처리하는 읽기 전용 MCP 서버는 요청당 CPU를 단 0-2ms만 사용하여 Cloudflare의 무료 티어 제한을 훨씬 밑도는 것으로 나타났습니다. 하지만 실시간 파싱이 수행될 경우 금세 10ms 제한에 도달하게 됩니다.
Hermes Agent bridges the gap between chatbots and programmable helpers by letting developers plug in shell commands, file I/O and custom services, all while storing context across sessions—all on their own hardware.
EON의 20개 위성 저궤도(LEO) 군집 위성 시스템은 고출력 레이저와 기상 변화에 대응 가능한 다양한 지상국을 활용하여 프랑스-호주와 같은 주요 노선에 테라비트급 링크를 제공하며, AI 활용도가 높은 고객들에게 전용 저지연 용량을 제공하는 것을 목표로 합니다.