Xiaomi ra mắt mã nguồn mở mô hình VLA robot thế hệ đầu tiên Xiaomi-Robotics-0, thiết lập nhiều kỷ lục SOTA mới.

VNZ-TECHS
Hôm nay, Xiaomi chính thức công bố mô hình VLA mã nguồn mở Xiaomi-Robotics-0 với 4,7 tỷ tham số, kết hợp khả năng hiểu thị giác, ngôn ngữ cùng năng lực thực thi thời gian thực hiệu năng cao, đồng thời làm mới nhiều chỉ số SOTA (State-of-the-Art). Không chỉ đạt kết quả xuất sắc trong ba bộ kiểm thử mô phỏng phổ biến, mô hình còn thể hiện khả năng tổng quát hóa trí tuệ vật lý trên robot thực tế, thao tác liền mạch, phản hồi nhanh nhạy và có thể suy luận thời gian thực trên GPU tiêu dùng.

Công nghệ Cốt lõi của trí tuệ vật lý nằm ở chất lượng vòng lặp khép kín “nhận thức, ra quyết định, thực thi”. Để cân bằng giữa khả năng hiểu tổng quát và điều khiển tinh vi, Xiaomi-Robotics-0 áp dụng kiến trúc Mixture-of-Transformers (MoT) đang phổ biến hiện nay.

Bộ não thị giác, ngôn ngữ (VLM):

Nhóm phát triển sử dụng một mô hình VLM đa phương thức cỡ lớn làm nền tảng. Mô hình này chịu trách nhiệm hiểu các chỉ dẫn mơ hồ của con người (ví dụ: “hãy gấp gọn chiếc khăn”), đồng thời nắm bắt các quan hệ không gian từ dữ liệu hình ảnh độ phân giải cao.

Tiểu não thực thi hành động (Action Expert):


Để tạo ra các chuyển động tần số cao và mượt mà, nhóm đã tích hợp nhiều lớp Diffusion Transformer (DiT). Thay vì xuất ra một hành động đơn lẻ, hệ thống tạo ra một “khối hành động” (Action Chunk), đồng thời sử dụng kỹ thuật Flow-matching để đảm bảo độ chính xác của chuyển động.

Xiaomi-VLM-DiT-1.webp

Kiến trúc mô hình và phương pháp huấn luyện: (a) Huấn luyện trước kết hợp đa phương thức và hành động VLM; (b) Huấn luyện trước cụ thể DiT; (c) Huấn luyện sau nhiệm vụ mục tiêu.

Phần lớn các mô hình VLA khi học hành động thường bị “kém thông minh” đi, đánh mất khả năng hiểu vốn có. Xiaomi áp dụng phương pháp huấn luyện trộn giữa dữ liệu đa phương thức và dữ liệu hành động, giúp mô hình vừa học thao tác, vừa duy trì năng lực mạnh mẽ về phát hiện vật thể, hỏi đáp thị giác và suy luận logic.

Huấn luyện phối hợp VLM:
Trước tiên, nhóm nghiên cứu đưa vào cơ chế Action Proposal, buộc mô hình VLM khi hiểu hình ảnh đồng thời phải dự đoán nhiều phân bố hành động khác nhau. Bước này nhằm căn chỉnh không gian đặc trưng của VLM với không gian hành động, giúp mô hình không chỉ “hiểu trên lý thuyết” mà còn gắn liền với khả năng thực thi.

Huấn luyện chuyên biệt DiT:
Sau đó, nhóm nghiên cứu đóng băng VLM và tập trung huấn luyện DiT, giúp mô hình học cách khôi phục chuỗi hành động chính xác từ nhiễu. Ở giai đoạn này, các token rời rạc của VLM được loại bỏ, hệ thống hoàn toàn dựa vào đặc trưng KV để sinh điều kiện. Nhờ quá trình huấn luyện chuyên biệt cho DiT, mô hình có thể tạo ra các chuỗi hành động mượt mà và có độ chính xác cao.

Xiaomi-Robot-opensoure-1.webp

Phân phối dữ liệu đa phương thức và dữ liệu robot xuyên thân
Trước vấn đề “đứt đoạn hành động” trên robot thật do độ trễ suy luận gây ra, nhóm nghiên cứu đã áp dụng chế độ suy luận bất đồng bộ, tách quá trình suy luận của mô hình khỏi ràng buộc đồng bộ với hoạt động của robot, cho phép thực thi song song một cách bất đồng bộ, từ đó bảo đảm hành động diễn ra liên tục và mượt mà về mặt cơ chế.

Để tiếp tục tăng cường khả năng phản ứng nhanh với thay đổi môi trường cũng như độ ổn định khi vận hành, nhóm đã đưa vào:
Clean Action Prefix:
Sử dụng hành động được dự đoán ở thời điểm trước đó làm đầu vào cho bước tiếp theo, đảm bảo quỹ đạo hành động liên tục theo trục thời gian, không bị giật hay rung, từ đó tăng thêm độ mượt.
Λ-shape Attention Mask:
Thông qua một cơ chế mặt nạ chú ý đặc biệt, mô hình bị “buộc” phải tập trung nhiều hơn vào phản hồi thị giác ở thời điểm hiện tại thay vì phụ thuộc quá nhiều vào quán tính từ dữ liệu lịch sử. Điều này giúp robot thể hiện khả năng phản ứng vật lý rất nhanh nhạy khi đối mặt với những thay đổi đột ngột trong môi trường.

Xiaomi-Robot-opensoure.jpg

Sơ đồ minh họa quá trình suy luận bất đồng bộ; độ trễ suy luận mô hình không ảnh hưởng đến hoạt động liên tục của thiết bị thực tế.
Xiaomi-VLM-DiT-2.jpg

Một cơ chế che chắn sự chú ý đặc biệt được sử dụng để giảm thiểu hiệu quả quán tính chuyển động.


Trong các bài kiểm tra đa chiều, Xiaomi-Robotics-0 đã thể hiện hiệu năng vượt trội:

Chuẩn mô phỏng:
Trong các bộ kiểm thử LIBERO, CALVIN và SimplerEnv, mô hình đạt kết quả tốt nhất hiện tại (SOTA) trên toàn bộ các benchmark, vượt qua 30 mô hình đối chiếu.

Xiaomi-Robotics-Opensource.webp

Thử thách thực tế:
Nhóm nghiên cứu đã triển khai mô hình trên nền tảng robot hai tay và thực hiện so sánh ngang hàng với các hệ thống hàng đầu trong ngành. Ở các nhiệm vụ dài hạn và có độ khó cao như tháo lắp khối gạch (lego) hay gấp khăn, robot thể hiện khả năng phối hợp tay, mắt cực kỳ chính xác. Dù là vật thể cứng như khối gạch hay vật liệu mềm như vải, hệ thống đều xử lý một cách linh hoạt và ổn định.
Năng lực đa phương thức:
Mô hình vẫn giữ được khả năng hiểu đa phương thức vốn có của VLM, đặc biệt thể hiện xuất sắc trong các benchmark liên quan mật thiết đến tác vụ robot hiện thân (embodied tasks) điều mà các mô hình VLA trước đây chưa làm được.


Thông tin tham khảo thêm ;


Trang kỹ thuật: https://xiaomi-robotics-0.github.io

Mã nguồn mở: https://github.com/XiaomiRobotics/Xiaomi-Robotics-0

Kho : https://huggingface.co/XiaomiRobotics
 
  • Like
haivu Reactions: haivu