ข้ามไปยังเนื้อหา
ผลการวัดจริง

เราพิสูจน์ได้ไหมว่าระบบนี้ช่วยจริง?

เราให้ระบบและโมเดลเปล่าตอบโจทย์ชุดเดียวกัน 60 ข้อ บนโมเดลฐานเดียวกัน แล้วให้ผู้ตัดสินให้คะแนนแบบปิดชื่อ นี่คือผลทั้งหมด รวมถึงข้อที่เรายังพิสูจน์ไม่ได้

2973.8

คะแนนคุณภาพคำตอบ (เต็ม 100) — โมเดลเปล่า เทียบกับ เปิดระบบ Innozight

เพิ่มขึ้น 44.8 แต้ม (+155%) · ชนะ 95% ของโจทย์ (57/60) · p < .001 · Cohen's d = 2.12

วัดยังไง

การทดสอบถูกออกแบบให้ต่างกันจุดเดียว คือเปิดหรือปิดระบบ Innozight ทุกอย่างที่เหลือถูกตรึงไว้เหมือนกันหมด

โมเดลฐานเดียวกัน

ทั้งสองฝั่งใช้โมเดลตัวเดียวกัน คำถามชุดเดียวกัน อุณหภูมิเดียวกัน ไม่มีการค้นเว็บ — ส่วนต่างจึงมาจากระบบ ไม่ใช่โมเดลที่แรงกว่า

ตัดสินแบบปิดชื่อ

ผู้ตัดสินไม่รู้ว่าคำตอบไหนของใคร สลับลำดับ 2 รอบ ให้คะแนนตามเกณฑ์ 13 ข้อ

โจทย์ 60 ข้อ

ครอบคลุมทุกขั้นของการทำโครงงาน — วิเคราะห์ปัญหา สัมภาษณ์ผู้ใช้ ตรวจความสอดคล้อง และการพิตช์

องค์ประกอบไหนที่ทำให้ดีขึ้น

เราเปิดระบบทีละชั้นบนโมเดลเดียวกัน เพื่อดูว่าคะแนนขยับเพราะอะไร คำตอบชัดมาก — การนำบริบทโครงการของผู้เรียนมาใช้คือตัวขับหลัก

โมเดลเปล่า (Claude Haiku)29
มัธยฐาน 24.1 · ผ่านเกณฑ์ 80 คะแนน 0% ของโจทย์
+ Innovation Prompt+8.237.2
มัธยฐาน 30.3 · ผ่านเกณฑ์ 80 คะแนน 3.3% ของโจทย์
+ บริบทโครงการ+36.173.4
มัธยฐาน 75.1 · ผ่านเกณฑ์ 80 คะแนน 35% ของโจทย์
Innozight เต็มระบบ (+ RAG)+0.473.8
มัธยฐาน 77.3 · ผ่านเกณฑ์ 80 คะแนน 38.3% ของโจทย์

สังเกตว่า Knowledge-RAG เพิ่มแค่ +0.4 เท่านั้น เรารายงานตามที่วัดได้ — ไม่ได้เคลมว่าทุกองค์ประกอบสำคัญเท่ากัน

ผูกกับโมเดลใดโมเดลหนึ่งหรือเปล่า

ไม่ — เราทดสอบซ้ำบนโมเดลจาก 3 ค่าย ระบบเพิ่มคุณภาพให้ทุกตัว

โมเดลฐานโมเดลเปล่า+ Innozightส่วนต่างชนะ
Claude Haiku27.865.3+37.592%
Gemini 3.5 Flash Lite28.870.6+41.892%
GPT-5.4-mini39.787.8+48.197%

สิ่งที่การวัดนี้ยังพิสูจน์ไม่ได้

ตัวเลขข้างบนมีขอบเขตของมัน ถ้าใครจะอ้างผลนี้ กรุณาอ้างข้อจำกัดเหล่านี้ไปด้วย

ผลการรันเมื่อ 23 กรกฎาคม 2026 · โจทย์ 60 ข้อ · เกณฑ์ 13 ข้อ · คะแนนคำนวณแบบ deterministic จากระดับที่ผู้ตัดสินให้ · หากต้องการข้อมูลดิบหรือระเบียบวิธีฉบับเต็มเพื่อตรวจสอบ ติดต่อเราได้

อยากตรวจสอบเองใช่ไหม

ขอข้อมูลดิบ ระเบียบวิธี หรือชุดโจทย์ที่ใช้ทดสอบได้ เรายินดีส่งให้

ติดต่อ