หมวดหมู่
Open Source
60 บทความ
Hermes Agent v0.18 — เวอร์ชันที่ทำให้ agent รู้ว่างานเสร็จจริงไหม แถมเห็นความจำได้
อัปเดต v0.18 ของ Hermes Agent เน้นให้ agent ตรวจงานตัวเองว่าเสร็จจริงหรือแค่เดา เพิ่ม completion contracts ปิดบั๊กสำคัญหมดทั้งรีโป และเปิดให้ไล่ดูหรือลบความจำที่ agent เก็บไว้ได้
Hermes Agent อัปเดต Kanban — หลาย agent ทำงานขนานบนบอร์ดเดียว ไม่ค้างกันแล้ว
Hermes Agent ออกอัปเดตบอร์ด Kanban แก้ปัญหาคอขวดที่ทำให้ agent ค้างกัน ย้ายการเซฟช้าไปทำเบื้องหลัง ให้หลาย agent รันขนานได้จริง พร้อมระบบเก็บประวัติและส่งงานให้คนตรวจเมื่อพลาดซ้ำ
OpenClaw ลงแอปมือถือแล้ว — ผู้ช่วย AI ที่รันบนเครื่องเรา สั่งผ่าน iPhone/Android
OpenClaw ผู้ช่วย AI โอเพนซอร์สแบบ self-hosted ออกแอปเนทีฟบน App Store และ Google Play แต่ตัวหลักยังต้องรันบนคอมของเรา มือถือทำหน้าที่เป็นรีโมตที่จับคู่ผ่าน QR
Meituan LongCat 2.0 — โมเดลเปิด 1.6 ล้านล้านพารามิเตอร์ ฝึกบนชิปนอกค่าย Nvidia
บริษัทส่งอาหารจีน Meituan ปล่อย LongCat 2.0 โมเดล MoE ขนาด 1.6 ล้านล้านพารามิเตอร์ ที่อาจเป็นโมเดลเปิดใหญ่ที่สุดเท่าที่เคยมี จุดที่น่าสนใจกว่าขนาดคือมันฝึกบนฮาร์ดแวร์ที่ไม่ใช่ Nvidia
GLM-5.2 โมเดลโค้ดดิ้งโอเพนซอร์ส — context ล้านโทเค็น เปิดให้รันเองได้
z.ai ปล่อย GLM-5.2 โมเดลเปิดสายโค้ด context 1 ล้านโทเค็น รันเองได้หรือเสียบเข้า agent ที่ใช้อยู่ ผลทดสอบหนึ่งสำนักบอกว่าใกล้รุ่นท็อปแบบปิดในงานสร้างจริง แต่ยังตามอยู่บนเบนช์มาร์กที่ยากที่สุด
OpenTag — ทางเลือกโอเพนซอร์สแทน Claude Tag ใช้โมเดลไหน/แชตไหนก็ได้
หลัง Claude Tag เปิดตัวไม่ถึงสัปดาห์ ก็มีเวอร์ชันโอเพนซอร์สชื่อ OpenTag ออกตามมา ใช้โมเดลอะไรก็ได้ โฮสต์เอง มี audit trail แลกกับการติดตั้งที่ยังไม่ใช่กดปุ่มเดียวจบ
Qwen Agent World — โมเดลเปิดที่ให้ agent "ซ้อมในซิม" ก่อนลงมือจริง
Alibaba ปล่อย Qwen Agent World โมเดล world model แบบเปิดและฟรี ที่ให้ agent จำลองผลลัพธ์ในโลกเสมือนก่อนแตะของจริง ครอบคลุม 7 สภาพแวดล้อมในโมเดลเดียว แต่ตัวเลขความเก่งยังเป็น benchmark ของผู้ผลิตเอง
DeepSeek-V4-Flash มาแล้ว — โมเดลเปิด MoE context 1M เปิดให้ใช้ฟรีช่วงสั้น ๆ
DeepSeek ปล่อยโมเดลเปิดตัวใหม่ DeepSeek-V4-Flash แบบ mixture-of-experts ใหญ่ 284B แต่ใช้งานจริงแค่ 13B ต่อครั้ง context ยาว 1 ล้าน token และเปิดให้ลองฟรีบนแพลตฟอร์มหนึ่งช่วงเวลาจำกัด
Hermes Agent เพิ่มโหมด Blank Slate — เปิด agent แบบโล่ง เปิดเฉพาะที่ใช้ ลด token ลดความเสี่ยง
Hermes Agent เพิ่มโหมดติดตั้ง Blank Slate ที่บูต agent ด้วยขั้นต่ำสุด ปิดความสามารถหลักไว้ก่อนแล้วค่อยเปิดเท่าที่จำเป็น ช่วยลด attack surface ลด token และคุมพฤติกรรมได้แม่นขึ้น โดยเฉพาะงาน client และ production
GLM 5.2 ผ่านเบนช์มาร์กอิสระ — โอเพนอันดับต้น หลอนต่ำสุด และรันที่บ้านได้แล้ว
หลังเปิดตัว GLM 5.2 มีข้อมูลจากหลายสำนักออกมา ทั้งขึ้นอันดับต้นของโอเพนบน AA Index, hallucination ต่ำสุดในกลุ่ม frontier, ติดอันดับ 3 บนเบนช์งานยาวที่เพิ่งสร้าง และชุมชนทำเวอร์ชันบีบอัดให้รันที่บ้านได้ใน 2 วัน
ponytail ภาคต่อ — เทสต์อิสระชี้ Opus 4.8 ประหยัด 53% เร็วขึ้น 71% แตะ 40,000 ดาวใน 7 วัน
หลังกระแสแรกของ ponytail รอบนี้มีคนรันเบนช์มาร์กอิสระ พบว่ายิ่งใช้โมเดลแพงอย่าง Opus 4.8 ยิ่งคุ้ม ประหยัด 53% เร็วขึ้น 71% และโค้ดน้อยลง 71%
GLM 5.2 ขึ้นอันดับ 1 ดีไซน์เว็บบน Design Arena — โมเดลโอเพนตัวแรกที่แซงสาย Claude
หลังเปิดตัวด้วยตัวเลขผู้ผลิต รอบนี้ GLM 5.2 ขึ้นอันดับ 1 ดีไซน์เว็บ single-turn บน Design Arena แซงทั้งสาย Claude รวม Fable 5 ในราคาประมาณ 1/10 ของรุ่นพรีเมียม
GLM 5.2 มีผลทดสอบอิสระแล้ว — แรงสุดในกลุ่ม open model พร้อม Z-Code ฟรี 5 ล้าน token/วัน
หลังเปิดตัวด้วยตัวเลขจากผู้ผลิต รอบนี้ GLM 5.2 มีผลจากสำนักทดสอบอิสระแล้ว ขึ้นเป็น open-weights ที่คะแนนสูงสุด และมี Z-Code ให้ลองฟรี 5 ล้าน token ต่อวัน
เปิดสเปก GLM 5.2 — เก่งงานดีไซน์ แต่ไฟล์โต ไม่มี vision
GLM 5.2 ปล่อยจริงแบบ open-weight ใต้ MIT license พร้อมตัวเลขสเปกเต็มและผลทดสอบงานหน้าบ้านที่ขึ้นอันดับ 1 บนกระดานเดียว แต่ตัวโมเดลใหญ่มากและยังไม่มี vision ในตัว
OpenClaw v6.6 มาแล้ว — งานนี้เน้นความปลอดภัยล้วน ๆ
OpenClaw ผู้ช่วย AI แบบ self-hosted ออกเวอร์ชัน 6.6 ยกเครื่องเรื่องความปลอดภัย ทั้ง fail closed, บล็อกคำสั่งแฝง และซ่อมบั๊กการตอบกลับบนหลายแพลตฟอร์ม
ponytail สกิลที่บังคับ Claude Code ให้เขียนโค้ดน้อยลง
ponytail เป็น open-source skill สำหรับ Claude Code ที่บังคับให้ตอบคำถามคัดกรอง 6 ข้อก่อนลงมือเขียนโค้ด เป้าหมายคือลด token และปริมาณโค้ดลง โดยตัวเลขทั้งหมดมาจาก repo เดียว ยังไม่มีใครยืนยันอิสระ
Kimi K2.7 Code - โมเดลโค้ด 1T MoE, context 256K, ใช้ thinking token น้อยลง 30%
Moonshot ปล่อย Kimi K2.7 Code โมเดลสายโค้ดแบบ MoE ราว 1 ล้านล้านพารามิเตอร์ context 256K เคลมใช้ thinking token น้อยลง 30% และทำคะแนน benchmark ของตัวเองสูงกว่ารุ่นก่อน
DiffusionGemma ของ Google - โมเดลข้อความที่สร้างทั้งก้อนพร้อมกัน เร็วทะลุพันโทเคนต่อวินาที
Google ปล่อย DiffusionGemma โมเดล open-source ที่สร้างข้อความแบบ diffusion แทนการไล่ทีละโทเคน เคลมเร็วได้เกิน 1,000 tokens ต่อวินาทีบน GPU แรง เหมาะกับงาน local ที่เน้นความเร็ว
GLM-5.2 มาแล้ว - context 1 ล้าน, open-weight, เก่งใกล้ Opus 4.8 แต่ถูกกว่าสิบเท่า
Z.ai ปล่อย GLM-5.2 เพิ่ม context window 1 ล้านโทเคน เป็น open-weight และตั้งเป้าสู้ Opus 4.8 ในราคา coding plan เริ่มราว 8 ดอลลาร์ต่อเดือน
Gemma 4 12B เหมาะเป็น local coding worker มากกว่าพระเอกคนเดียว
Gemma 4 12B ถูกพูดถึงมากขึ้นในฐานะโมเดล local สำหรับ coding และ agent งานที่เหมาะคือเป็น worker ราคาต่ำ/ส่วนตัว แล้วให้คนหรือโมเดลหลักตรวจต่อ