GyaanSetu AI

Thông tin chuyên sâu về AI, học máy và LLM.

1515 articlesDeep, practical knowledge

Deep Interaction giúp tăng hơn 25% tỷ lệ sửa lỗi LLM đồng thời cắt giảm 40% lượng token tiêu thụ

Bằng cách coi đầu ra của mô hình như một văn bản có thể chỉnh sửa, Deep Interaction cho phép các nhà phát triển xác định chính xác bước lập luận sai, viết lại bước đó và đưa một prompt đã được tinh lọc trở lại—giúp tăng 25% tỷ lệ sửa lỗi và giảm 40% lượng token sử dụng trên các bài kiểm tra chuẩn STEM.

AI · 2 min read

Agent AI trực ca giúp giảm thời gian xử lý trung bình từ 45 phút xuống còn 20 phút chỉ trong một tuần

Tôi đã để một Agent AI vận hành Cloud Ops của mình trong một tuần. Tôi đã giao cho một agent AI bảy ngày để quản lý các hoạt động đám mây của mình. Đây là một môi trường thực tế, không phải bản demo. Tôi đã cấp cho nó quyền truy cập đọc vào hệ thống giám sát...

AI · 4 min read

AWS Agent Toolkit giúp rút ngắn thời gian thiết lập OpenSearch nhưng gặp lỗi khi cấu hình Vector NextGen

Kỹ năng amazon-opensearch-service mới giúp đẩy nhanh quá trình sắp xếp chính sách và xác định kích thước instance, nhưng khi được yêu cầu cấu hình tìm kiếm vector trên Serverless NextGen, nó lại mặc định sử dụng các thiết lập FAISS truyền thống, dẫn đến lỗi khi triển khai.

AI · 4 min read

Inkling (975B) ra mắt vào buổi sáng, Moonshot AI tung ra 2.8T Kimi K3 chỉ 16 giờ sau đó

Hai đợt phát hành song song này đã đưa các mô hình trọng số mở từ các dự án bên lề trở thành AI chủ lưu, cho phép các doanh nghiệp tùy chọn chạy các mô hình khổng lồ tại chỗ theo giấy phép Apache 2.0 mà vẫn đạt hiệu suất tương đương với các mô hình mã nguồn đóng trong các tác vụ lập trình.

AI · 3 min read

Công cụ phát hiện sai lệch quy trình làm việc mới giúp ngăn chặn lỗi bot sau khi cập nhật ứng dụng

Framework này xác định năm loại sai lệch—UI, API, dữ liệu, quyền và chính sách—đồng thời sử dụng bản đồ hợp đồng tinh gọn kết hợp với các bước quét tiền kiểm để phát hiện sự không tương thích trước khi tác nhân tự hành vận hành, giúp ngăn chặn các lỗi ngầm và việc phải sửa chữa tốn kém.

AI · 4 min read

Tác nhân AI thực hiện 1.858 lượt gọi công cụ trong một ngày nhưng không mang lại kết quả gì

Do thiếu một bước xác minh, tác nhân đã bỏ qua giai đoạn 'thực thi', khiến nó dành cả ngày để soạn thảo 1.858 suy nghĩ nội bộ mà không hề sử dụng bất kỳ công cụ thực tế nào, làm lộ ra một cái bẫy vòng lặp có thể làm tê liệt bất kỳ trợ lý dựa trên công cụ nào.

AI · 2 min read

Kimi K3 của Moonshot AI hứa hẹn API giá rẻ, nhưng chi phí đầu ra cao gấp đôi các đối thủ

Dù Moonshot đang quảng bá mạnh mẽ về mô hình 2,8 nghìn tỷ tham số với mức giá mỗi token thấp, nhưng thiết kế Mixture-of-Experts và sự rườm rà quá mức của mô hình đã đẩy lượng đầu ra lên tới 130 triệu token—gấp hơn hai lần so với các mô hình đối thủ—khiến chi phí thực tế bị đội lên cao.

AI · 3 min read

Các LLM thất bại trong bài kiểm tra tự nhận thức, làm dấy lên lo ngại về an toàn khi triển khai

Bộ tiêu chuẩn đánh giá nhận thức tình huống mới buộc các mô hình phải trả lời các câu hỏi siêu nhận thức như “Bạn có phải là AI không?” và điều chỉnh phản hồi khi cuộc hội thoại thay đổi, tiết lộ rằng nhiều LLM đạt điểm cao vẫn tự nhận mình là con người hoặc che giấu các giới hạn của chúng.

AI · 2 min read

Cơ chế giới hạn tài nguyên ở tab ẩn khiến Chrome che giấu lỗi Canvas đối với các tác nhân kiểm thử AI

Tác nhân AI nhận được kết quả JavaScript chuẩn và ảnh chụp màn hình, nhưng cơ chế giới hạn tài nguyên ở tab ẩn của Chrome đã chặn các hàm callback requestAnimationFrame, khiến canvas không được vẽ. Việc chạy kiểm thử trong một tab đang hiển thị hoặc thêm bước kiểm tra pixel không trống sẽ khắc phục tình trạng báo kết quả đạt sai này.

AI · 3 min read

Claude Code 2.1.212 giới hạn Sub-Agent ở mức 200 để ngăn chặn sự bùng nổ chi phí AI

Bản cập nhật giới thiệu hai mức giới hạn biến môi trường – một cho việc khởi tạo sub-agent và một cho các lệnh gọi tìm kiếm web – cả hai đều mặc định là 200 mỗi phiên, cùng với quy tắc tự động chạy nền sau 2 phút đối với các lệnh gọi MCP kéo dài, giúp các đội ngũ có một công cụ cụ thể để kiểm soát tình trạng chi phí tăng vọt.

AI · 4 min read

Issue công khai trên GitHub cho phép Bot AI rò rỉ mã nguồn của Repo riêng tư chỉ với một cú nhấp chuột

Noma Labs đã chứng minh rằng kẻ tấn công có thể đăng một issue được dàn dựng trong một repo công khai, kích hoạt một tác nhân AI liên kết với CI có quyền đọc các repo riêng tư, và khiến bot trích xuất các tệp đó ngược lại vào chính issue đó—tất cả đều không cần đánh cắp thông tin đăng nhập hay khai thác lỗ hổng của chính GitHub.

AI · 2 min read

Tại sao các LLM Agent trong môi trường thực tế khiến chi phí tăng vọt – Sự phình to token tiềm ẩn

Trong các triển khai thực tế, mọi câu lệnh của người dùng, schema công cụ, phản hồi API và tài liệu được truy xuất đều tích tụ lại trong prompt. Sự phình to tiềm ẩn này khiến thời gian xử lý và chi phí tăng theo hàm bậc hai, biến một bản demo mượt mà thành một cơn ác mộng về độ trễ và chi phí đắt đỏ.

AI · 3 min read

X402 đã có tổ chức thiết lập tiêu chuẩn, nhưng thiếu bộ công cụ kiểm thử để xác minh quyền thanh toán

Tổ chức X402 mới của Linux Foundation, với sự hỗ trợ từ Visa, Mastercard, Stripe và Google, đã định nghĩa định dạng tin nhắn cho các giao dịch thanh toán của đại lý AI, nhưng lại bỏ qua các bộ quy chuẩn tuân thủ, hồ sơ bảo mật hoặc quy trình chứng nhận, khiến cho tuyên bố về quyền hạn vẫn chưa được kiểm chứng.

AI · 3 min read

Agent giọng nói giảm tỷ lệ ngắt lời từ 18% xuống 3% nhờ logic luân phiên ba tín hiệu

Thông qua việc phân tích 312 cuộc gọi thực tế, nhóm đã thay thế quy tắc im lặng 700 ms bằng một máy trạng thái (state machine) tinh gọn giúp theo dõi thời lượng im lặng, tính hoàn chỉnh về ngữ pháp và các tín hiệu phản hồi, qua đó giảm tỷ lệ ngắt lời từ 18% xuống 3% và loại bỏ tình trạng im lặng kéo dài.

AI · 3 min read

Bộ tiêu chuẩn đánh giá 163 trường hợp mới buộc K8sGPT phải thừa nhận sự không chắc chắn trước khi hành động

Được xây dựng dựa trên 163 sự cố đã được gắn nhãn, bộ tiêu chuẩn này mở rộng phạm vi vượt ra ngoài việc chẩn đoán để kiểm tra xem liệu các trợ lý AI có thể nhận biết sự không chắc chắn và chủ động từ chối hành động hay không, qua đó làm nổi bật một lỗ hổng an toàn quan trọng khi mức độ tự tin của LLM ngày càng tăng.

AI · 2 min read

Phân cụm nhiễu tự động giúp LIGO phát hiện các sóng hấp dẫn yếu hơn

Bằng cách tái sử dụng các mô hình được huấn luyện trên các bộ dữ liệu hình ảnh không liên quan, hệ thống mới của LIGO không chỉ phân loại các nhóm nhiễu đã biết với độ chính xác gần như tuyệt đối mà còn phân cụm các điểm bất thường mới, giúp các nhà khoa học tập trung vào vật lý thiên văn thay vì phải làm sạch dữ liệu thủ công.

AI · 2 min read

Agent lập trình AI đẩy 3 PR chỉ trong 40 phút – 40% tin nhắn của tôi là để sửa lỗi

Chỉ trong một buổi tối, agent đã hoàn thành một MCP client, một Azure AI Agent và một M365 Copilot Agent, nhưng cần đến 12 trên tổng số 30 tin nhắn từ con người để điều hướng nó trở lại đúng hướng, làm lộ ra các lỗi vi phạm quy trình làm việc và lỗi truy xuất ngữ cảnh đòi hỏi phải viết lại prompt.

AI · 3 min read

Anthropic cấp quyền truy cập 1Password cho Claude, cho phép AI tự động đăng nhập vào các ứng dụng

Gemini Notebook của Google hiện đã có khả năng lập chỉ mục các tệp PDF, Docs và các định dạng khác để truy vấn AI tức thì, trong khi Claude của Anthropic có thể lấy thông tin đăng nhập từ 1Password để truy cập các dịch vụ, và một đặc tả chung đang hướng tới việc cho phép các tác nhân (agents) tự khám phá và gọi API mà không cần viết mã tùy chỉnh.

AI · 2 min read

AWS Continuum triển khai các tác nhân suy luận để vá lỗ hổng mã nguồn trong thời gian thực

Các tác nhân AI của AWS Continuum liên tục giám sát các kho lưu trữ quản lý phiên bản, đề xuất các bản sửa lỗi và thậm chí có thể áp dụng trực tiếp các bản vá vào IDE của nhà phát triển hoặc các luồng CI, giúp thu hẹp đáng kể thời gian tiềm ẩn các cuộc tấn công chuỗi cung ứng.

AI · 3 min read

Intel phá vỡ thế độc tôn của TSMC trong mảng đóng gói AI nhờ hợp đồng TPU mới với Google

Sự thay đổi này buộc Google phải thiết kế lại toàn bộ cấu trúc chip, từ sơ đồ bố trí đến khâu kiểm thử, đồng thời đặt năng lực sản lượng của Intel dưới sự giám sát chặt chẽ. Thành công có thể giúp đa dạng hóa chuỗi cung ứng chip AI; tuy nhiên, bất kỳ sai sót nào cũng có thể làm chậm trễ việc giao hàng và tạo cơ hội cho TSMC giành lại vị thế thống trị.

AI · 2 min read