รีวิว Gemini Task Automation: AI ที่กดแอปสั่งอาหารแทนคุณ ฟรี 5 ครั้งต่อวัน
Gemini ควบคุมแอปสั่งอาหาร เรียกรถบนมือถือแทนคุณได้แล้ว ผมขุดข้อมูลจริงมาเล่าว่าใช้ได้จริงแค่ไหน

ลองนึกภาพว่าคุณกำลังนั่งทำงานอยู่ แล้วอยากสั่งมื้อเที่ยง แต่ไม่อยากเสียเวลาหยิบมือถือมาเปิดแอป เลื่อนหาร้าน กดเลือกเมนูทีละสเต็ป คุณเพียงแค่สั่งด้วยเสียงว่า "สั่งไก่ทอดจาก Uber Eats ให้หน่อย"
จากนั้นสมาร์ตโฟนจะเปิดแอปขึ้นมาเอง ค้นหาร้าน เลือกเมนู เพิ่มลงตะกร้า กดข้ามหน้าโปรโมชัน ไปจนถึงหน้าชำระเงิน แล้วส่งเสียงแจ้งเตือนกลับมาว่า "เตรียมรายการให้เรียบร้อยแล้ว กดแตะจ่ายเงินได้เลย"
Google ได้เปลี่ยนภาพจินตนาการนี้ให้กลายเป็นฟีเจอร์ใช้งานได้จริงแล้ว ในชื่อ Gemini Task Automation
ก้าวสำคัญของ Mobile AI Agent
ในงาน Samsung Galaxy Unpacked 2026 ณ ซานฟรานซิสโก ทาง Google และ Samsung ได้เปิดตัวฟีเจอร์ Gemini Task Automation อย่างเป็นทางการ
นี่ไม่ใช่แค่การสั่งให้ AI เปิดแอป หรือตอบคำถามทั่วไป แต่คือการให้โมเดลควบคุมหน้าจอแอปแทนเราโดยตรง ทั้งการเลื่อนหน้าจอ (Scroll), แตะปุ่ม (Tap) และพิมพ์ข้อมูล (Type) เหมือนมีผู้ช่วยคอยกดหน้าจอสมาร์ตโฟนให้
เทคโนโลยีนี้ต่อยอดมาจาก Project Astra ที่ Google เคยเผยโฉมไว้ โดยเริ่มเปิดให้ใช้งานบนอุปกรณ์ Samsung Galaxy S26 Series และ Google Pixel 10 Series ในสหรัฐอเมริกาและเกาหลีใต้เป็นกลุ่มแรก
หลักการทำงาน: อ่าน UI ผ่าน Vision โดยไม่ต้องพึ่งพา API
จุดเด่นของ Gemini Task Automation อยู่ที่ วิธีการประมวลผล
ระบบใช้ Vision Model ในการจับภาพหน้าจอแอปพลิเคชัน วิเคราะห์ตำแหน่งปุ่ม กล่องข้อความ และเมนูต่างๆ ได้เองโดยตรง โดยที่นักพัฒนาแอปภายนอกไม่ต้องเขียน API พิเศษเพื่อรองรับ
ต่างจากแนวทางเดิมที่ผู้ช่วย AI ต้องรอคำสั่งหรือ Schema ที่กำหนดไว้ล่วงหน้า Gemini อาศัยการ "มองเห็น" หน้าจอเหมือนที่ตามนุษย์มอง จึงสามารถนำทาง UI ที่มีความซับซ้อนได้อย่างอิสระ
แอปพลิเคชันจะรันบน Virtual Window ภายในเครื่อง โดยส่งภาพหน้าจอไปให้โมเดลประมวลผลตรรกะการกดบนคลาวด์ ผู้ใช้สามารถเลือกที่จะดูขั้นตอนการทำงานแบบสดๆ บนหน้าจอ หรือปล่อยให้ทำงานอยู่เบื้องหลังได้
ผลการทดสอบใช้งานจริง
Allison Johnson จากสื่อ The Verge ได้ทดสอบระบบบน Galaxy S26 Ultra โดยสั่งให้เรียกรถ Uber ไปยังสนามบิน เมื่อข้อมูลยังไม่ชัดเจน ตัว AI สามารถหยุดเพื่อถามกลับว่า "ต้องการไปสนามบินใด" ก่อนจะเปิดแอป กรอกจุดหมายปลายทาง และเตรียมรายการไว้ให้ตรวจสอบก่อนยืนยัน
ในการทดลองสั่งเครื่องดื่มจาก Starbucks เมื่อสั่ง Flat White คู่กับ Chocolate Croissant ระบบสามารถค้นหาเมนูในหมวดเครื่องดื่มร้อน และตัดสินใจเลือกตัวเลือก "อุ่นร้อน" ให้ขนมปังโดยอัตโนมัติ
"การนั่งมองมือถือเปิดและใช้งานแอปพลิเคชันด้วยตัวเอง เป็นประสบการณ์ที่แปลกใหม่มาก" (Allison Johnson จาก The Verge)
อย่างไรก็ตาม สื่ออย่าง 9to5Google รายงานว่ายังพบข้อจำกัดและบั๊กประปรายในสถานะ Beta เช่น อาการหน้าจอ Fullscreen ค้างระหว่างเปิดพรีวิวขั้นตอนจนต้อง Force Reboot เครื่อง รวมถึงความเร็วในการทำงานที่ยังไม่เทียบเท่ากับการที่ผู้ใช้กดสั่งด้วยตนเอง แต่มีประโยชน์มากในสถานการณ์ที่ไม่สะดวกจับหน้าจอ เช่น ขณะขับรถหรือทำอาหาร
เงื่อนไขการใช้งานและแพ็กเกจราคา
ปัจจุบันระบบรองรับแอปพลิเคชันยอดนิยมในสหรัฐฯ เช่น DoorDash, Grubhub, Instacart, Lyft, McDonald's, Starbucks, Uber และ Uber Eats รวมถึงแอปพลิเคชันชั้นนำในเกาหลีใต้อย่าง Baemin และ Kakao T
- โควต้าฟรี: ใช้งานได้ฟรี 5 ครั้งต่อวัน
- แพ็กเกจเสริม: เริ่มต้นที่ 7.99 ดอลลาร์ต่อเดือนสำหรับ 12 ครั้งต่อวัน ไปจนถึงแพ็กเกจระดับพรีเมียมสำหรับการใช้งานต่อเนื่อง
- ความต้องการของระบบ: ใช้งานได้บน Galaxy S26 และ Pixel 10 ที่รัน Android 16 ขึ้นไป รองรับคำสั่งเสียงภาษาอังกฤษเป็นหลัก
มาตรการความปลอดภัยและความเป็นส่วนตัว
เพื่อป้องกันความผิดพลาดทางการเงิน Gemini จะหยุดการทำงานอัตโนมัติก่อนขั้นตอนการตัดเงินทุกครั้ง และส่งแจ้งเตือนให้ผู้ใช้เป็นผู้กดยืนยันการชำระเงินด้วยตนเองเสมอ พร้อมปุ่มหยุดการทำงาน (Cancel) ได้ตลอดเวลา
ในแง่ของความเป็นส่วนตัว ภาพหน้าจอที่ระบบบันทึกระหว่างประมวลผลอาจถูกนำไปใช้ปรับปรุงโมเดลตามการตั้งค่าของผู้ใช้ ผู้ใช้งานจึงควรระมัดระวังเรื่องข้อมูลส่วนบุคคลที่อาจปรากฏบนหน้าจอ
อนาคตของระบบ AppFunctions บน Android
ในระยะยาว Google กำลังผลักดันเฟรมเวิร์กใหม่ในชื่อ AppFunctions บน Android 16 ซึ่งเปรียบเสมือนมาตรฐาน MCP (Model Context Protocol) ฝั่ง On-device ที่เปิดให้นักพัฒนาเปิดช่องทางให้ AI สั่งงานฟังก์ชันภายในแอปได้โดยตรงและรวดเร็วยิ่งขึ้น แทนการวิเคราะห์ภาพหน้าจอเพียงอย่างเดียว
เมื่อระบบ AppFunctions แพร่หลายมากขึ้น ความแม่นยำและความเร็วของ AI Agent บนอุปกรณ์พกพาจะก้าวกระโดดขึ้นอย่างมีนัยสำคัญ
สรุป
Gemini Task Automation คือตัวอย่างที่ชัดเจนว่า AI กำลังเปลี่ยนผ่านจากการเป็นเพียงคู่สนทนาในกล่องแชท สู่การเป็น Agent ที่ลงมือปฏิบัติงานจริงบนสมาร์ตโฟน
แม้ปัจจุบันจะยังจำกัดอยู่ในบางภูมิภาคและบางภาษา แต่นี่คือทิศทางที่ชัดเจนของการใช้งานสมาร์ตโฟนในอนาคตอันใกล้ ที่คำสั่งเสียงและการทำงานอัตโนมัติจะเข้ามามีบทบาทในชีวิตประจำวันมากยิ่งขึ้น
แหล่งอ้างอิง
- TechCrunch: Gemini can now automate some multi-step tasks on Android
- 9to5Google: Gemini Android app automation Galaxy S26 rollout
- 9to5Google: Gemini screen automation usage limits
- 9to5Google: Google details AppFunctions that let Gemini use Android apps
- 9to5Google: Gemini screen automation rolling out to Pixel 10
- Kingy AI: Inside Google's Gemini AI Automation (สรุปรีวิว The Verge)
- Samsung Global Newsroom: Galaxy Unpacked 2026: The Beginning of Truly Agentic AI
- Android Authority: Gemini gets one step closer to controlling other apps
ชอบเรื่องแนวนี้ มีอีบุ๊คฟรีให้อ่านต่อ
Local LLM ฉบับเข้าใจง่าย รัน AI ไว้ในเครื่องตัวเอง ติดตั้ง อัปเดต จัดการ ลบ ครบวงจรด้วย Ollama
กดสมัครแล้วเราจะส่งเทคนิค AI และของแจกใหม่ๆ ให้ทางอีเมล เลิกรับได้ตลอด
สร้าง AI Automation Pipeline ทุกแบบ ด้วย Agents และ Skills

ปูจากพื้นฐาน prompt, context และ cost ไปจนปั้น Skill สั่ง Agent กับ Sub-agent แล้วต่อทุกอย่างเป็น pipeline อัตโนมัติที่ออกแบบเองได้ ดูฟรี 7 บทก่อนตัดสินใจ


