GyaanSetu AI

AI, 머신러닝 및 LLM 인사이트.

1515 articlesDeep, practical knowledge

SkewAdam, MoE 학습 메모리 60% 절감 – 6.78B 모델을 단일 40GB GPU에서 구동

SkewAdam은 Adam의 모멘트를 재계층화하여, 밀집 백본(dense backbone)에는 전체 정밀도 모멘텀을 유지하고 전문가 뱅크(expert bank)의 분산은 인자 근사(factor-approximating) 방식으로 처리합니다. 그 결과 최대 GPU 사용량을 81.4GB에서 31.3GB로 낮추었으며, 퍼플렉서티(perplexity)를 126.8에서 108.4로 개선했습니다.

AI · 2 min read

Claude가 리포지토리를 분석해 브랜드 맞춤형 목업을 생성함으로써 디자인-코드 핸드오프 과정을 단축합니다

새로운 /design 명령어를 사용하면 개발자는 “/design a few options for a login screen”과 같은 프롬프트를 입력하여, 라이브 코드베이스의 컬러 팔레트와 컴포넌트 라이브러리를 활용한 여러 개의 고정밀 아트보드를 Claude 워크스페이스에서 직접 받아볼 수 있습니다.

AI · 4 min read

운영 환경 IAM 역할 유출로 AI가 라이브 스택을 삭제하는 사고 발생, 새로운 Slack 승인 절차 도입

한 엔지니어의 AI 코딩 에이전트가 운영 IAM 역할을 상속받아 라이브 CloudFormation 스택을 생성한 직후 삭제하는 사고가 발생하며, 주변 자격 증명(ambient credentials)의 위험성이 드러났습니다. 이에 팀은 모든 권한 요청이 Slack 기반의 사람 승인 단계를 거치도록 하는 액세스 브로커를 배포하여 대응했습니다.

AI · 4 min read

Nemotron 3.5 Lightning AWS 출시, 기업의 LLM 하드웨어 비용 획기적 절감

이제 개발자는 클릭 한 번으로 SageMaker JumpStart 콘솔에서 Nemotron 3.5 Lightning을 즉시 실행할 수 있으며, 별도의 GPU 클러스터, 드라이버 설치 또는 커스텀 컨테이너를 구축할 필요가 없습니다. 가격은 토큰 기반이며 지역에 따라 다를 수 있으므로, 실제 운영에 적용하기 전에 지연 시간과 정확도를 반드시 검증해야 합니다.

AI · 2 min read

Anthropic의 워터마크 API, 전체 문서 업로드 요구로 개인정보 보호 우려 촉발

Anthropic의 탐지 엔드포인트는 사용자가 Claude로 생성된 문서 전체를 업로드하도록 요구하며, 이 과정에서 회사가 에세이, 이력서, 계약서 및 연구 자료에 접근할 수 있게 됩니다. 워터마크 자체는 개인을 식별할 수 있는 정보가 아니지만, 수집된 대량의 데이터가 보관되거나 다른 용도로 재사용될 가능성이 있습니다.

AI · 2 min read

180M 파라미터 LLM, 10달러짜리 ESP32-P4 마이크로컨트롤러에서 구동

p-for-llm 프로젝트는 1억 8,090만 파라미터 규모의 MoE(Mixture-of-Experts) 모델을 6~10달러에 판매되는 ESP32-P4에 탑재했습니다. 삼진 가중치(ternary weights)를 사용하여 초당 약 9개의 토큰을 생성하며, 이 모든 과정은 단 한 대의 소비자용 RTX 5060 Ti에서 학습되었습니다.

AI · 2 min read

AI 에이전트 기술의 57.8%가 사양 위반, 2,465개 리스팅 감사 결과

2,465개의 공개 AI 에이전트 기술을 감사한 결과, 이름 불일치, 깨진 링크, 절대 파일 경로, 심지어 노출된 API 키를 포함하여 57.8%가 사양을 위반하고 있는 것으로 나타났습니다. 더욱 엄격한 검증 파이프라인이 없다면, 에이전트는 워크플로 실패 및 보안 노출의 위험에 처할 수 있습니다.

AI · 4 min read

DeepSeek V4 Pro GA 출시, 추론 토큰 18-62% 절감 – 개발자 비용 부담 완화

변경 사항 목록(changelog) 없이 발표된 이번 GA 출시는 추론 토큰 사용량을 최대 62%까지 대폭 줄여 종량제 사용자들에게 즉각적인 비용 절감 효과를 제공합니다. 다만, 모델의 내장된 거부 동작이 사라졌으며, 정확한 JSON 출력을 위해서는 'thinking' 플래그를 비활성화해야 합니다.

AI · 2 min read

46건의 경찰 남용 보고 이후, Flock이 사건 번호 입력을 의무화하다

이번 감시 조치 변화는 워싱턴 포스트의 조사 결과, 경찰관들이 Flock의 12만 대 카메라 네트워크를 개인적인 스토킹 및 기타 무단 검색에 사용한 사례가 46건 드러난 데 따른 것으로, 이로 인해 회사는 현재 검증되지 않은 사건 번호 필드 입력을 강제하게 되었습니다.

AI · 3 min read

Kog Claims 30x Faster LLM Decoding on Existing Nvidia H200 GPUs

Kog’s Kog Inference Engine (KIE) rewrites low-level GPU code to keep memory pipes full, achieving 3,000 tokens per second on a 2-billion-parameter model. Backed by Scaleway and French Tech 2030, the startup now targets a 10x boost on a larger enterprise model.

AI · 5 min read