Zhiyuan Robotics ra mắt GO-2: Mô hình AI robot “tri hành hợp nhất”, đạt SOTA trên nhiều benchmark | VN-Z | Cộng đồng Chia Sẻ Kiến Thức Công Nghệ và Phần Mềm Máy Tính

Zhiyuan Robotics ra mắt GO-2: Mô hình AI robot “tri hành hợp nhất”, đạt SOTA trên nhiều benchmark

VNZ-TECHS

Administrator
Zhiyuan công bố mô hình nền tảng embodied thế hệ mới GO-2, giúp robot “tri hành hợp nhất”

Zhiyuan Robotics hôm nay đã phát hành mô hình nền tảng embodied thế hệ mới Genie Operator-2 (viết tắt là GO-2). Mô hình này nhằm giải quyết sự đứt gãy giữa “hiểu ý định” và “thực thi ổn định” của robot, kết nối chuỗi từ suy luận logic đến thực thi hành động chính xác trong một kiến trúc thống nhất.

Genie-Operator-2-1.webp

​
Theo giới thiệu, GO-2 đưa vào cơ chế “chuỗi tư duy hành động”. Mô hình sẽ không trực tiếp xuất tín hiệu điều khiển, mà trước tiên tạo ra một chuỗi hành động cấp cao làm kế hoạch tổng thể cho nhiệm vụ, mô tả hướng hành vi, cấu trúc và lộ trình thực thi. Các nhiệm vụ phức tạp được phân tách thành các bước hành động có thứ tự, sau đó được thực thi ổn định thông qua hệ thống kép bất đồng bộ. Thiết kế này giúp robot chuyển từ “vừa nhìn vừa làm” sang “nghĩ rõ rồi mới làm”, giảm sai lệch thực thi và nâng cao độ ổn định hành vi. Thành quả liên quan đã được hội nghị CVPR 2026 chấp nhận. GO-2 đạt thành tích SOTA trong nhiều bài kiểm tra robot.

Khi một robot đứng trước bạn, bạn nói: “Hãy đưa cái cốc lại đây.” Nó hiểu, biết cái cốc là gì, ở đâu, thậm chí trong “đầu” đã vạch ra một lộ trình hoàn hảo. Nhưng đến khoảnh khắc thực sự vươn tay thực hiện, hành động thường lại lệch khỏi kế hoạch và không thể hoàn thành ổn định.


Vì sao lại như vậy? Trong thời gian dài, hệ thống robot luôn bị mắc kẹt trong một sự chia tách sâu sắc: năng lực suy luận và ngữ nghĩa cấp cao đã đủ thông minh, năng lực vận động động học tầng thấp cũng ngày càng hoàn thiện—các động tác như giữ thăng bằng, chạy, nhảy, nhào lộn đều đã rất ổn định trơn tru. Nhưng khi bước vào môi trường thực tế, đối mặt với nhiệm vụ phức tạp và cần tương tác chính xác với thế giới vật lý, giữa “hiểu ý định” và “hoàn thành ổn định” vẫn tồn tại một rào cản vô hình.

Robot có thể tạo ra kế hoạch hợp lý, nhưng khó thực thi ổn định trong môi trường có nhiễu; có thể “hiểu rõ”, nhưng chưa chắc “làm tốt”. Đây chính là thách thức cốt lõi để embodied AI tiến ra thế giới thực và ứng dụng thực tiễn.

SOTA.webp

​
GO-2 lần đầu tiên trong một kiến trúc thống nhất đã kết nối “kilomet cuối cùng” từ suy luận logic đến thực thi hành động chính xác. Kết hợp với hàng chục nghìn giờ dữ liệu huấn luyện, mô hình đã đạt SOTA trong nhiều benchmark robot, giúp robot chuyển từ “tìm kiếm kiểu hộp đen” sang “tri hành hợp nhất” thực sự.

01 / Tiến hóa của dòng GO: từ nhận thức đến thực thi​

Một năm trước, Zhiyuan đã phát hành Genie Operator-1 (GO-1), thông qua kiến trúc ViLLA lần đầu tiên thực hiện mô hình hóa thống nhất thị giác – ngôn ngữ – hành động. Đây là bước đột phá mang tính cột mốc: GO-1 được đề cử giải bài báo xuất sắc tại IROS, được tạp chí TRO chấp nhận, giành giải SAIL Star tại Hội nghị Trí tuệ Nhân tạo Thế giới, đồng thời đã được tích hợp vào nền tảng phát triển Genie Studio và triển khai quy mô lớn trong thực tế.

GO-1 giúp robot học cách “hiểu”: hiểu chỉ lệnh, nhận diện môi trường, lập kế hoạch nhiệm vụ.

Tuy nhiên, khi bước vào môi trường thực tế phức tạp hơn, một vấn đề quan trọng dần lộ rõ: robot có thể lập kế hoạch hợp lý, nhưng hành động không phải lúc nào cũng tuân theo kế hoạch đó.

Ví dụ: bạn yêu cầu robot dọn bếp. Nó biết cần lấy bát đĩa từ bồn rửa, cho vào máy rửa, rồi khởi động. Nhưng khi thực hiện, sai lệch nhỏ trong thị giác hoặc quỹ đạo tay có thể khiến bát trượt rơi, dẫn đến thất bại.
Vấn đề không nằm ở kế hoạch, mà nằm ở sự đứt gãy giữa “lập kế hoạch” và “thực thi” — chính là khoảng cách ngữ nghĩa – hành động (Semantic-Actuation Gap).

02 / Tri hành hợp nhất​

Để đạt được điều này, hệ thống cần giải quyết hai vấn đề:
  • Làm sao tạo ra kế hoạch hành động có thể thực thi
  • Làm sao thực thi kế hoạch đó ổn định trong môi trường thực
GO-2 xây dựng kiến trúc hoàn chỉnh: chuỗi tư duy hành động + hệ thống kép bất đồng bộ.

Genie-Operator-2-01.webp

​

03 / Chuỗi tư duy hành động​


Trong phương pháp truyền thống, mô hình thường trực tiếp tạo tín hiệu điều khiển, khiến “suy nghĩ” và “thực thi” bị gộp lại.

GO-2 thay đổi cách tiếp cận:
  • Không xuất tín hiệu ngay
  • Trước tiên tạo chuỗi hành động cấp cao
  • Chuỗi này là biểu diễn trung gian có thể thực thi
Nhờ đó, nhiệm vụ phức tạp được chia thành các bước rõ ràng, robot chuyển từ “vừa nhìn vừa làm” sang “nghĩ rồi mới làm”, giảm sai lệch và tăng độ ổn định.

04 / Hệ thống kép bất đồng bộ​


GO-2 tách:
  • Hệ thống chậm: lập kế hoạch
  • Hệ thống nhanh: thực thi
Hệ thống nhanh liên tục:
  • Nhận kế hoạch
  • Kết hợp dữ liệu môi trường
  • Điều chỉnh hành động theo thời gian thực
Ví dụ:
  • Bàn cao → điều chỉnh tay
  • Vật trơn → điều chỉnh lực
Trong huấn luyện, GO-2 sử dụng “teacher forcing có nhiễu” để đảm bảo vẫn thực thi ổn định khi kế hoạch không hoàn hảo.

Genie-Operator-2-03-1.webp

​
Nguồn https://libra-vla.github.io/

05 / Hiệu năng​

GO-2 đạt SOTA trong nhiều benchmark:
  • LIBERO: 98.5%
  • LIBERO-Plus: 86.6%
  • VLABench: 47.4
  • Genie Sim 3.0: 82.9%

06 / Ứng dụng thực tế​


GO-2 kết hợp:
  • mô hình nền tảng
  • học tăng cường
  • vòng lặp dữ liệu
Robot có thể:
  • học liên tục
  • tự cải thiện
  • thích ứng môi trường thực

Mục tiêu của embodied AI là “tri hành hợp nhất”.

GO-2 giúp robot:
  • không chỉ hiểu
  • mà còn hành động ổn định trong thế giới thực
Đây là bước tiến quan trọng đưa robot từ “hiểu thế giới” sang “tác động thực sự đến thế giới”.
 


Top