Gemini คือตระกูลโมเดล AI ล่าสุดของ Google ที่ออกแบบมาให้เข้าใจและประมวลผลข้อมูลได้หลายรูปแบบพร้อมกัน ไม่ว่าจะเป็นข้อความ รูปภาพ วิดีโอ เสียง หรือโค้ด ต่างจากโมเดลเก่าที่มักรับได้แค่ข้อความอย่างเดียว Gemini มีหลายเวอร์ชันตั้งแต่ Ultra (ใหญ่สุด ทรงพลังสุด) ไปจนถึง Nano (เล็กพอใช้ในมือถือ) ซึ่ง Google นำมาใช้ในหลายบริการ เช่น Bard (ที่เปลี่ยนชื่อเป็น Gemini ไปแล้ว) และ Google Workspace
ตัวอย่างการใช้งานจริงเช่น คุณอัปโหลดรูปใบเสร็จแล้วถาม Gemini ว่ามีรายการอะไรบ้าง มันก็อ่านออกและสรุปให้ หรือถ่ายรูปกราฟจากหนังสือแล้วให้มันอธิบายความหมาย หรือแม้แต่ให้วิเคราะห์โค้ดและแนะนำการแก้ไข ความสามารถแบบ multimodal นี้ทำให้ Gemini ใช้งานได้กว้างกว่าโมเดลที่รับแค่ข้อความ และเป็นคู่แข่งหลักของ GPT-4 จาก OpenAI ในตลาด AI ตอนนี้