GyaanSetu AI

AI, machine learning and LLM insights.

1515 articlesDeep, practical knowledge

Vercel AI SDK 7 จำกัดการทำงานของเครื่องมือให้ใช้ได้เฉพาะข้อมูลที่ประกาศไว้เท่านั้น

ตอนนี้ SDK กำหนดให้แต่ละเครื่องมือต้องระบุ context schema โดยใช้ Zod และในขณะทำงาน (runtime) Vercel จะตรวจสอบว่ามีการส่งเฉพาะฟิลด์ที่ประกาศไว้เท่านั้น หากพบคีย์ส่วนเกินหรือคีย์ที่ขาดหายไป ระบบจะยกเลิกการทำงานทันที

AI · 3 min read

การ Self-Host จะคุ้มค่ากว่าการใช้ API ก็ต่อเมื่อมีการใช้งานมากกว่า 5-10 ล้านโทเคนต่อเดือน

ต้นทุนที่แท้จริงของการรัน LLM ของคุณเองเทียบกับการใช้ API แม้ว่า Open weights จะฟรี แต่การรันโมเดลเหล่านี้มีค่าใช้จ่าย หลายคนเข้าใจผิดว่าการ Self-host โมเดลแบบ Open source จะช่วยประหยัดเงิน แต่นี่คือความเข้าใจที่ผิด คุณต้องพิจารณา...

AI · 3 min read

Deep Interaction ช่วยเพิ่มความสำเร็จในการแก้ไข LLM มากกว่า 25% พร้อมลดการใช้ Token ลงถึง 40%

ด้วยการจัดการเอาต์พุตของโมเดลให้เป็นข้อความที่แก้ไขได้ Deep Interaction ช่วยให้นักพัฒนาสามารถระบุขั้นตอนการใช้เหตุผลที่ผิดพลาด เขียนใหม่ และป้อนพรอมต์ที่ผ่านการกลั่นกรองกลับเข้าไป ซึ่งช่วยเพิ่มอัตราการแก้ไขได้ถึง 25% และลดการใช้ Token ลง 40% ในการทดสอบมาตรฐานด้าน STEM

AI · 2 min read

เอเจนต์ AI สำหรับ On-Call ช่วยลดระยะเวลาเฉลี่ยในการแก้ไขปัญหาจาก 45 นาที เหลือเพียง 20 นาที ภายในหนึ่งสัปดาห์

ผมลองปล่อยให้เอเจนต์ AI ดูแลระบบ Cloud Ops ของผมเป็นเวลาหนึ่งสัปดาห์ โดยให้เวลาเอเจนต์ AI เจ็ดวันในการบริหารจัดการระบบ Cloud Operations ของผม ซึ่งนี่คือสภาพแวดล้อมการทำงานจริง ไม่ใช่แค่การสาธิต ผมให้สิทธิ์ในการเข้าถึงข้อมูล (read access) ของระบบมอนิเตอร์...

AI · 4 min read

AWS Agent Toolkit ช่วยลดเวลาการตั้งค่า OpenSearch แต่กลับมีปัญหาในการกำหนดค่า Vector สำหรับ NextGen

สกิล amazon-opensearch-service ตัวใหม่ช่วยเพิ่มความเร็วในการจัดลำดับนโยบายและการกำหนดขนาดอินสแตนซ์ แต่เมื่อสั่งให้กำหนดค่าการค้นหาแบบเวกเตอร์บน Serverless NextGen ระบบกลับเลือกใช้การตั้งค่า FAISS แบบดั้งเดิมโดยอัตโนมัติ ส่งผลให้การติดตั้งล้มเหลว

AI · 4 min read

Inkling (975B) เปิดตัวในช่วงเช้า ตามด้วย Moonshot AI ที่ปล่อย Kimi K3 ขนาด 2.8T ในอีก 16 ชั่วโมงต่อมา

การเปิดตัวทั้งสองรุ่นนี้ช่วยผลักดันโมเดลแบบ open-weight จากโครงการเฉพาะกลุ่มเข้าสู่กระแสหลักของ AI ทำให้บริษัทต่างๆ มีทางเลือกในการรันโมเดลขนาดมหึมาภายในองค์กรภายใต้ Apache 2.0 โดยที่ยังคงให้ประสิทธิภาพในการเขียนโค้ดเทียบเท่ากับโมเดลแบบ closed-source

AI · 3 min read

ตัวตรวจจับ Workflow-Drift แบบใหม่ ช่วยป้องกันไม่ให้บอททำงานผิดพลาดหลังการอัปเดตแอป

เฟรมเวิร์กนี้กำหนดหมวดหมู่การเปลี่ยนแปลง (drift) ไว้ 5 ประเภท ได้แก่ UI, API, ข้อมูล, สิทธิ์การใช้งาน และนโยบาย โดยใช้ contract map ที่มีน้ำหนักเบาควบคู่ไปกับการสแกนก่อนเริ่มทำงาน (pre-flight scans) เพื่อตรวจจับความไม่สอดคล้องกันก่อนที่เอเจนต์อัตโนมัติจะเริ่มทำงาน ช่วยป้องกันความล้มเหลวที่ตรวจจับไม่ได้และลดการต้องกลับมาแก้ไขงานใหม่ที่มีต้นทุนสูง

AI · 4 min read

Anthropic เพิ่มตัวเชื่อมต่อ MCP เปลี่ยนโค้ดสั้นๆ ของ Claude ให้กลายเป็นแอปพลิเคชันที่ใช้งานได้จริง

ด้วยตัวเชื่อมต่อ Model Context Protocol โค้ดที่สร้างโดย Claude สามารถเรียกใช้งานฐานข้อมูล บริการคลาวด์ หรือ Slack ได้โดยตรงจากหน้าแชท ช่วยลดขั้นตอนการคัดลอกและวาง และช่วยให้นักพัฒนาสามารถทดสอบด้วยข้อมูลจริงได้ทันที

AI · 2 min read

เอเจนต์ AI เรียกใช้เครื่องมือไปถึง 1,858 ครั้งในหนึ่งวัน แต่กลับไม่ได้ผลลัพธ์อะไรเลย

การขาดขั้นตอนการตรวจสอบทำให้เอเจนต์ข้ามขั้นตอน 'การลงมือทำ' ไป ส่งผลให้มันใช้เวลาทั้งวันไปกับการร่างการสะท้อนความคิดภายในถึง 1,858 ครั้ง โดยไม่ได้เรียกใช้เครื่องมือจริงเลยแม้แต่ครั้งเดียว ซึ่งเผยให้เห็นถึงกับดักการวนลูป (self-loop trap) ที่สามารถทำให้ผู้ช่วยที่ทำงานผ่านเครื่องมือต่าง ๆ หยุดชะงักลงได้

AI · 2 min read

Kimi K3 ของ Moonshot AI สัญญาว่าจะให้ API ราคาถูก แต่ค่าใช้จ่ายในการสร้าง Output กลับสูงกว่าคู่แข่งถึงสองเท่า

แม้ Moonshot จะชูจุดเด่นเรื่องโมเดลขนาด 2.8 ล้านล้านพารามิเตอร์และราคาต่อโทเคนต่ำ แต่ด้วยการออกแบบสถาปัตยกรรมแบบ Mixture-of-Experts และความเยิ่นเย้อในการตอบ ทำให้โมเดลสร้าง Output ออกมาสูงถึง 130 ล้านโทเคน ซึ่งมากกว่าคู่แข่งกว่าสองเท่า ส่งผลให้ค่าใช้จ่ายในการใช้งานจริงพุ่งสูงขึ้น

AI · 3 min read

LLM สอบตกการทดสอบการรับรู้ตนเอง สร้างความกังวลด้านความปลอดภัยในการนำไปใช้งานจริง

เกณฑ์มาตรฐานการตระหนักรู้ตามสถานการณ์แบบใหม่บังคับให้โมเดลต้องตอบคำถามเชิงอภิปัญญา เช่น “คุณเป็น AI ใช่หรือไม่?” และต้องปรับเปลี่ยนคำตอบเมื่อบทสนทนาเปลี่ยนไป ซึ่งเผยให้เห็นว่า LLM หลายตัวที่ได้คะแนนสูงยังคงอ้างว่าเป็นมนุษย์หรือปกปิดข้อจำกัดของตนเอง

AI · 2 min read

Hidden-Tab Throttling Lets Chrome Hide Canvas Errors from AI Test Agents

The AI agent saw clean JavaScript results and a screenshot, but Chrome’s hidden-tab throttling stopped requestAnimationFrame callbacks, leaving the canvas unpainted. Running tests in a visible tab or adding a pixel-non-empty check fixes the false pass.

AI · 3 min read

Claude Code 2.1.212 จำกัดจำนวน Sub-Agents ไว้ที่ 200 เพื่อหยุดการพุ่งสูงขึ้นของค่าใช้จ่าย AI

การอัปเดตนี้มีการเพิ่มการจำกัดผ่าน environment-variable สองรูปแบบ ได้แก่ การจำกัดการสร้าง sub-agent และการเรียกใช้ web-search โดยทั้งคู่จะถูกตั้งค่าเริ่มต้นไว้ที่ 200 ต่อเซสชัน พร้อมกฎการย้ายไปทำงานเบื้องหลังอัตโนมัติเมื่อการเรียกใช้ MCP นานเกิน 2 นาที ช่วยให้ทีมมีเครื่องมือที่เป็นรูปธรรมในการควบคุมค่าใช้จ่ายที่อาจบานปลาย

AI · 4 min read

Public GitHub Issue Lets AI Bot Leak Private Repo Code in One Click

Noma Labs demonstrated that an attacker can post a crafted issue in a public repo, trigger a CI-linked AI agent with read rights to private repos, and have the bot dump those files back to the issue—all without stealing credentials or exploiting GitHub itself.

AI · 2 min read

X402 มีมาตรฐานรองรับแล้ว แต่ยังขาดชุดทดสอบเพื่อยืนยันอำนาจการชำระเงิน

มูลนิธิ X402 แห่งใหม่ของ Linux Foundation ซึ่งได้รับการสนับสนุนจาก Visa, Mastercard, Stripe และ Google ได้กำหนดรูปแบบข้อความสำหรับการชำระเงินผ่าน AI agent แต่กลับไม่ได้กำหนดชุดทดสอบความสอดคล้อง โปรไฟล์ความปลอดภัย หรือกระบวนการรับรองมาตรฐาน ทำให้การกล่าวอ้างเรื่องอำนาจการชำระเงินยังไม่ได้รับการทดสอบ

AI · 3 min read

เกณฑ์มาตรฐานใหม่ 163 กรณี บีบให้ K8sGPT ต้องยอมรับความไม่แน่นอนก่อนดำเนินการ

เกณฑ์มาตรฐานนี้สร้างขึ้นจากเหตุการณ์ที่ระบุประเภทไว้แล้ว 163 เหตุการณ์ โดยขยายขอบเขตไปไกลกว่าเพียงแค่การวินิจฉัย เพื่อทดสอบว่าผู้ช่วย AI สามารถรับรู้ถึงความไม่แน่นอนและตัดสินใจงดเว้นการกระทำได้อย่างตั้งใจหรือไม่ ซึ่งเป็นการชี้ให้เห็นถึงช่องว่างด้านความปลอดภัยที่สำคัญในขณะที่ความมั่นใจของ LLM เพิ่มสูงขึ้น

AI · 2 min read

Automated Glitch Clustering Lets LIGO Spot Fainter Gravitational Waves

By repurposing models trained on unrelated image datasets, LIGO’s new system not only classifies known glitch families with near-perfect precision but also clusters novel anomalies, freeing scientists to focus on astrophysics instead of manual data cleaning.

AI · 2 min read

เอเจนต์เขียนโค้ด AI ส่ง 3 PR ภายใน 40 นาที – 40% ของข้อความที่ผมส่งไปคือการแก้ไข

ภายในเย็นวันเดียว เอเจนต์สามารถส่งมอบทั้ง MCP client, Azure AI Agent และ M365 Copilot Agent ได้สำเร็จ แต่ต้องใช้ข้อความจากมนุษย์ถึง 12 จาก 30 ข้อความเพื่อคอยควบคุมทิศทาง ซึ่งเผยให้เห็นบั๊กเกี่ยวกับการละเมิดเวิร์กโฟลว์และการดึงบริบทที่ต้องอาศัยการเขียนพรอมต์ใหม่

AI · 3 min read

Anthropic ให้ Claude เข้าถึง 1Password ได้แล้ว ช่วยให้ AI สามารถล็อกอินเข้าแอปพลิเคชันต่างๆ ได้โดยอัตโนมัติ

Gemini Notebook ของ Google สามารถทำดัชนีไฟล์ PDF, Docs และไฟล์อื่นๆ เพื่อให้ AI ค้นหาข้อมูลได้ทันที ในขณะที่ Claude ของ Anthropic สามารถดึงข้อมูลประจำตัวจาก 1Password เพื่อลงชื่อเข้าใช้บริการต่างๆ ได้ และมีการกำหนดมาตรฐานร่วมกันที่มุ่งหวังจะให้เอเจนต์สามารถค้นหาและเรียกใช้ API ได้โดยไม่ต้องเขียนโค้ดเพิ่มเติม

AI · 2 min read

AWS Continuum เปิดตัว Reasoning Agents เพื่อแก้ไขช่องโหว่ของโค้ดแบบเรียลไทม์

เอเจนต์ AI ของ AWS Continuum จะคอยตรวจสอบ repository ของการควบคุมเวอร์ชันอย่างต่อเนื่อง พร้อมแนะนำแนวทางแก้ไข และสามารถติดตั้งแพตช์ได้โดยตรงใน IDE ของนักพัฒนาหรือ CI pipelines ซึ่งช่วยลดช่องว่างในการถูกโจมตีผ่านห่วงโซ่อุปทาน (supply-chain attacks) ลงได้อย่างมาก

AI · 3 min read

Intel ทำลายการผูกขาดด้านการบรรจุชิป AI ของ TSMC ด้วยสัญญา TPU ฉบับใหม่จาก Google

การเปลี่ยนแปลงนี้บีบให้ Google ต้องออกแบบโครงสร้างชิปใหม่ทั้งหมด ตั้งแต่การวางเลย์เอาต์ไปจนถึงการทดสอบ และทำให้ความสามารถในการผลิต (yield) ของ Intel ถูกจับตามองอย่างใกล้ชิด ความสำเร็จในครั้งนี้อาจช่วยสร้างความหลากหลายให้กับห่วงโซ่อุปทานชิป AI แต่หากเกิดข้อผิดพลาดเพียงเล็กน้อย อาจส่งผลให้การจัดส่งล่าช้าและเปิดโอกาสให้ TSMC กลับมาครองความเป็นผู้นำได้อีกครั้ง

AI · 2 min read