คำสั่งว่า “เปิดเว็บผู้ขาย หาใบแจ้งหนี้ที่ครบกำหนด แล้วเตรียมรายการชำระเงิน” ฟังดูเหมือนงานเดียว แต่จริง ๆ มีอย่างน้อยสามช่วงที่ความเสี่ยงไม่เท่ากัน ได้แก่ การเปิดเว็บไซต์ การอ่านข้อมูลหลังลงชื่อเข้าใช้ และการกดปุ่มที่ทำให้ข้อมูลหรือเงินเปลี่ยนสถานะ
เมื่อ AI ทำงานผ่านหน้าจอเว็บ การอนุมัติจึงต้องละเอียดกว่าคำว่า “อนุญาตให้เข้าเว็บนี้”
OpenAI บันทึกไว้ใน changelog ว่า วันที่ 29 กันยายน 2026 ได้เพิ่ม computer use ให้ Agents API โดย agent ทำงานในเบราว์เซอร์ที่ OpenAI โฮสต์ ส่วนแอปพลิเคชันของผู้พัฒนารับผิดชอบขั้นตอนอนุมัติเข้าเว็บไซต์และการลงชื่อเข้าใช้ (OpenAI API changelog) บทความนี้เผยแพร่วันที่ 1 ตุลาคม 2026 จึงเป็นการอธิบายการอัปเดตใหม่และหลักควบคุมที่ควรพิจารณา ไม่ใช่ข้อสรุปว่า AI พร้อมทำงานทุกชนิดแทนคนโดยไม่ต้องกำกับ
Agent ที่ใช้เบราว์เซอร์มีขอบเขตต่างจาก API อย่างไร
ระบบที่เชื่อมผ่าน API หรือ MCP มักเรียกคำสั่งที่กำหนดรูปแบบไว้ล่วงหน้า เช่น ค้นหาลูกค้า อ่านยอดคงเหลือ หรือสร้างใบสั่งขาย ขอบเขตจึงผูกกับเครื่องมือ โครงสร้างข้อมูล และสิทธิ์ของบัญชีที่ระบบเตรียมไว้ แม้ยังต้องออกแบบสิทธิ์และตรวจผลให้รอบคอบ แต่ทีมพัฒนามองเห็นรายการคำสั่งที่เปิดให้ใช้ได้ชัด
AI ที่ทำงานผ่านเบราว์เซอร์มองและใช้องค์ประกอบบนหน้าจอเหมือนผู้ใช้ มันช่วยทำงานกับเว็บที่ไม่มี API หรือมีขั้นตอนกระจายอยู่หลายหน้าได้ แต่ขอบเขตของการทำงานอาจกว้างตามสิ่งที่บัญชีนั้นมองเห็นและกดได้
ความต่างนี้ไม่ได้แปลว่าวิธีใดปลอดภัยกว่าโดยอัตโนมัติ หากงานเหมาะกับ API ที่กำหนดคำสั่งแคบและตรวจสอบง่าย วิธีนั้นมักควบคุมได้ตรงกว่า ส่วน computer use เหมาะกับงานที่จำเป็นต้องผ่านหน้าจอเว็บจริง แต่ควรเริ่มจากขอบเขตเล็กและมีจุดหยุดที่ระบบบังคับได้
อนุมัติให้เข้าเว็บไซต์ ไม่ได้เท่ากับอนุมัติทุกปุ่ม
เอกสาร computer use ระบุว่า เบราว์เซอร์ต้องขออนุมัติก่อนเข้า origin ใหม่แต่ละแห่ง แม้เป็นเว็บไซต์สาธารณะ และการเปิด network access ไม่ได้อนุมัติคำขอเหล่านี้ให้เอง (OpenAI, Handle origin access)
ข้อจำกัดที่ต้องอ่านต่อคือ origin approval ไม่ได้บังคับให้ยืนยันก่อนทุกการกระทำภายในเว็บไซต์นั้น เมื่ออนุมัติเข้าโดเมนแล้ว agent อาจเดินต่อไปยังปุ่มหรือแบบฟอร์มอื่นตามงานที่ได้รับ หากธุรกิจต้องรับประกันว่าจะมีคนยืนยันก่อนซื้อสินค้า ลบข้อมูล หรือทำรายการที่มีผลสำคัญ OpenAI แนะนำให้จำกัดเบราว์เซอร์ไว้กับทรัพยากรที่ทำรายการเหล่านั้นไม่ได้ หรือใช้ browser runtime ที่องค์กรควบคุมเอง การถามยืนยันผ่าน function tool ยังพึ่งว่า agent จะเรียก function นั้นตามที่ออกแบบไว้ จึงไม่ควรถือเป็นกำแพงบังคับเพียงชั้นเดียว (OpenAI, Computer use)
จุดนี้เปลี่ยนคำถามจาก “AI เข้าเว็บอะไรได้บ้าง” เป็น “หลังเข้าแล้ว มีการกระทำใดที่ระบบต้องหยุดรอคนเสมอ”
ห้าจุดควบคุมก่อนให้งานออกนอกระบบทดสอบ
เริ่มจากงานอ่าน ค้นหา และทดสอบ ให้ agent เปิดหน้าที่กำหนด ค้นข้อมูล หรือรวบรวมรายการก่อน โดยยังไม่กรอก ส่ง แก้ไข หรือลบข้อมูล เมื่อทีมรู้ว่าหน้าเว็บเปลี่ยนอย่างไรและผลลัพธ์ที่ผิดพลาดหน้าตาแบบไหน จึงค่อยพิจารณางานเขียนข้อมูล
จำกัดปลายทางที่เครือข่ายเข้าถึงได้ เอกสารระบุว่า network configuration ใช้ควบคุม outbound access ของเบราว์เซอร์และโค้ดในสภาพแวดล้อม อนุญาตเฉพาะเว็บไซต์ปลายทางและโดเมนที่จำเป็นต่อทรัพยากรหรือการเปลี่ยนเส้นทาง ไม่ควรเปิดอินเทอร์เน็ตกว้างกว่าความต้องการของงาน (OpenAI, Control network access)
ให้แอปพลิเคชันจัดการการลงชื่อเข้าใช้ OpenAI กำหนดให้แอปของผู้พัฒนาแสดงปลายทางและรับข้อมูลเข้าสู่ระบบจากผู้ใช้ โดยส่งค่าผ่านช่องทางสำหรับ browser authentication ข้อมูลที่ส่งวิธีนี้ไม่เข้า model input แต่แอปยังต้องปิดบังข้อมูล ละเว้นจาก log และล้างฟอร์มหลังส่ง (OpenAI, Handle sign-in)
กำหนดกฎอนุมัติจากชนิดของผลกระทบ งานดูข้อมูลอาจเดินต่อได้ภายใต้บัญชีสิทธิ์ต่ำ งานกรอกแบบร่างควรหยุดก่อนส่ง ส่วนงานซื้อ ชำระ ลบ เปลี่ยนสิทธิ์ หรือเผยแพร่สู่ภายนอกควรมีการยืนยันที่แอปหรือ runtime บังคับได้ อย่าฝากความปลอดภัยไว้กับข้อความใน prompt อย่างเดียว
ตรวจสถานะปลายทางหลังจบงาน การที่ agent รายงานว่าเสร็จไม่ได้ยืนยันว่าเว็บไซต์บันทึกข้อมูลถูกต้อง ทีมควรตรวจรายการที่ปลายทาง ประวัติกิจกรรม ผู้อนุมัติ เวลา และค่าก่อนกับหลังทำงาน โดยเฉพาะรายการที่ retry อาจทำให้เกิดข้อมูลซ้ำ
ตัวอย่างทดลองที่ไม่เริ่มจากการชำระเงินจริง
สมมติว่าฝ่ายบัญชีต้องดึงใบแจ้งหนี้จากพอร์ทัลผู้ขายหลายราย ตัวอย่างนี้เป็นแนวทางออกแบบ ไม่ใช่ระบบที่ Enersys อ้างว่าใช้งานแล้ว
รอบแรกให้ agent เข้าเฉพาะ origin ของพอร์ทัลที่อยู่ในรายชื่ออนุญาต ลงชื่อเข้าใช้ผ่านหน้าที่แอปจัดการ แล้วค้นหาเอกสารที่ครบกำหนด จากนั้นดาวน์โหลดหรือสรุปรายการเพื่อให้เจ้าหน้าที่ตรวจ งานจบตรงนี้โดยไม่เปิดหน้าชำระเงิน
รอบถัดไปอาจให้ agent กรอกแบบร่างในระบบภายใน แต่หยุดก่อนส่ง ผู้รับผิดชอบตรวจชื่อผู้ขาย เลขที่เอกสาร ยอดเงิน และบัญชีปลายทาง แล้วจึงส่งรายการผ่านขั้นตอนที่องค์กรควบคุมเอง หากเว็บเดียวกันเปิดทางให้ชำระเงินได้และ runtime ไม่สามารถบังคับจุดยืนยันรายรายการ ควรแยกงานนั้นออกจากเบราว์เซอร์ที่ agent ใช้
การทดสอบควรครอบคลุมกรณีที่เว็บไซต์เปลี่ยนหน้าตา มีหน้าต่างแทรก การลงชื่อเข้าใช้หมดอายุ หรือเจอลิงก์ที่พาออกนอก origin ที่อนุญาต รวมถึงตรวจว่าเมื่อยกเลิกหรือเชื่อมต่อขาด ระบบไม่ส่งคำสั่งเดิมซ้ำโดยไม่ตรวจสถานะก่อน
ก่อนเปิดใช้จริง เจ้าของกระบวนการควรตอบอะไรได้
- งานนี้จบที่การอ่าน การเตรียมแบบร่าง หรือการเปลี่ยนสถานะจริง
- บัญชีที่ agent ใช้มองเห็นข้อมูลและปุ่มใดบ้าง
- origin และโดเมนประกอบใดจำเป็นต่อการทำงาน
- ขั้นตอนไหนต้องหยุดรอผู้มีอำนาจอนุมัติทุกครั้ง
- ระบบใดเป็นผู้บังคับจุดหยุดนั้น และมีวิธีพิสูจน์หรือไม่
- หลังจบงาน ใครตรวจผลจากระบบปลายทางและจัดการรายการซ้ำ
- หากหน้าจอหรือขั้นตอนเปลี่ยน จะหยุด agent และทดสอบใหม่อย่างไร
Computer use ทำให้ AI ช่วยงานที่ยังผูกกับหน้าจอเว็บได้มากขึ้น แต่การอนุมัติเข้าเว็บไซต์เป็นเพียงประตูแรก ธุรกิจควรวางจุดอนุมัติตามผลกระทบของแต่ละการกระทำ และให้ระบบบังคับจุดหยุดสำหรับงานที่ย้อนกลับยากหรือมีผลต่อเงิน ข้อมูล และสิทธิ์ของผู้อื่น