คะแนนคุณภาพคำตอบ (เต็ม 100) — โมเดลเปล่า เทียบกับ เปิดระบบ Innozight
เพิ่มขึ้น 44.8 แต้ม (+155%) · ชนะ 95% ของโจทย์ (57/60) · p < .001 · Cohen's d = 2.12
วัดยังไง
การทดสอบถูกออกแบบให้ต่างกันจุดเดียว คือเปิดหรือปิดระบบ Innozight ทุกอย่างที่เหลือถูกตรึงไว้เหมือนกันหมด
ทั้งสองฝั่งใช้โมเดลตัวเดียวกัน คำถามชุดเดียวกัน อุณหภูมิเดียวกัน ไม่มีการค้นเว็บ — ส่วนต่างจึงมาจากระบบ ไม่ใช่โมเดลที่แรงกว่า
ผู้ตัดสินไม่รู้ว่าคำตอบไหนของใคร สลับลำดับ 2 รอบ ให้คะแนนตามเกณฑ์ 13 ข้อ
ครอบคลุมทุกขั้นของการทำโครงงาน — วิเคราะห์ปัญหา สัมภาษณ์ผู้ใช้ ตรวจความสอดคล้อง และการพิตช์
องค์ประกอบไหนที่ทำให้ดีขึ้น
เราเปิดระบบทีละชั้นบนโมเดลเดียวกัน เพื่อดูว่าคะแนนขยับเพราะอะไร คำตอบชัดมาก — การนำบริบทโครงการของผู้เรียนมาใช้คือตัวขับหลัก
สังเกตว่า Knowledge-RAG เพิ่มแค่ +0.4 เท่านั้น เรารายงานตามที่วัดได้ — ไม่ได้เคลมว่าทุกองค์ประกอบสำคัญเท่ากัน
ผูกกับโมเดลใดโมเดลหนึ่งหรือเปล่า
ไม่ — เราทดสอบซ้ำบนโมเดลจาก 3 ค่าย ระบบเพิ่มคุณภาพให้ทุกตัว
| โมเดลฐาน | โมเดลเปล่า | + Innozight | ส่วนต่าง | ชนะ |
|---|---|---|---|---|
| Claude Haiku | 27.8 | 65.3 | +37.5 | 92% |
| Gemini 3.5 Flash Lite | 28.8 | 70.6 | +41.8 | 92% |
| GPT-5.4-mini | 39.7 | 87.8 | +48.1 | 97% |
สิ่งที่การวัดนี้ยังพิสูจน์ไม่ได้
ตัวเลขข้างบนมีขอบเขตของมัน ถ้าใครจะอ้างผลนี้ กรุณาอ้างข้อจำกัดเหล่านี้ไปด้วย
- วัด “คุณภาพของคำตอบ” ไม่ได้วัดผลการเรียนรู้ของผู้เรียน — การที่คำตอบดีขึ้นไม่ได้พิสูจน์ว่าผู้เรียนเก่งขึ้น
- ผู้ตัดสินเป็น AI ไม่ใช่มนุษย์ แม้จะปิดชื่อระบบและสลับลำดับ 2 รอบเพื่อลดอคติ แต่ยังไม่ใช่การประเมินโดยครูจริง
- ทดสอบบนโจทย์มาตรฐาน 60 ข้อ ซึ่งครอบคลุมทุกขั้นของการทำโครงงาน แต่ยังไม่ใช่การใช้งานจริงในห้องเรียน
- การเพิ่มขึ้นเกือบทั้งหมดมาจากการฉีดบริบทโครงการ (+36.1) ส่วน Knowledge-RAG เพิ่มเพียง +0.4 — เรารายงานตามที่วัดได้ ไม่ได้เคลมว่าทุกองค์ประกอบสำคัญเท่ากัน
- อัตราการแต่งข้อมูล (hallucination) ขยับจาก 1.7% เป็น 3.3% เมื่อเปิด RAG โดยช่วงความเชื่อมั่นทับกัน — ยังสรุปไม่ได้ว่าแย่ลงจริง
ผลการรันเมื่อ 23 กรกฎาคม 2026 · โจทย์ 60 ข้อ · เกณฑ์ 13 ข้อ · คะแนนคำนวณแบบ deterministic จากระดับที่ผู้ตัดสินให้ · หากต้องการข้อมูลดิบหรือระเบียบวิธีฉบับเต็มเพื่อตรวจสอบ ติดต่อเราได้
