| 일 | 월 | 화 | 수 | 목 | 금 | 토 |
|---|---|---|---|---|---|---|
| 1 | 2 | 3 | 4 | 5 | ||
| 6 | 7 | 8 | 9 | 10 | 11 | 12 |
| 13 | 14 | 15 | 16 | 17 | 18 | 19 |
| 20 | 21 | 22 | 23 | 24 | 25 | 26 |
| 27 | 28 | 29 | 30 |
- world model
- vla
- VLA/WFM #Manipulator
- 코드 트리 #개발자 #언어 공부 #코딩 공부
- Infotaxis
- ROS1
- 세계에서 이 세상이 사라진다 해도
- ROS2
- dino #grounding dino #vlm #object detection
- 책 #오늘 밤
- vision language model #transformer
- vlm #clip #object detection
- 탐색
- 로봇 #로봇공학과 #공대생 #대학생 #일상 #휴무 #교수
- 자율주행 #로봇공학과
- vlm 정리 #glip #object detection
- 소울러닝 #책리뷰 #느낀점
- 개발 일기
- planning #ste #논문 리뷰
- AirSim #RL #Drone
- 경로 계획
- path planning #mcts
- DRONE
- Pick-and-place #VLA #매니퓰레이터 #이기종
- 정보이론
- ste
- Unity
- Today
- Total
목록전체 글 (25)
퇴근할게요 교수님
이번 프로젝트에서는 RB5-850E manipulator를 이용하여 Pick-and-Place 환경을 구축하고, 이후 VLA(Vision-Language-Action) 모델 학습에 활용할 수 있는 데이터를 자동으로 생성하는 것을 목표로 했다. 처음에는 단일 RB5를 이용하여 Pick-and-Place를 구현했고, 이후 두 대의 RB5가 협력하여 하나의 물체를 전달하는 dual-arm relay Pick-and-Place 환경으로 확장하였다. VLA 모델을 fine-tuning하기 위해서는 로봇의 observation과 action이 포함된 많은 demonstration dataset이 필요하다. 하지만 실제 로봇을 이용하여 수백~수천 회의 데이터를 직접 수집하는 것은 시간과 비용 측면에서 부담이 크다. ..
논문 리뷰와 함께 새로운 연구 분야인 이기종 매니퓰레이터, 나아가 휴머노이드 로봇까지 공부하고 직접 다뤄보려고 한다. 최근 물류와 제조 공정의 자동화가 중요한 화두로 떠오르면서, 다양한 환경과 작업에 유연하게 대응할 수 있는 지능형 로봇의 중요성도 함께 커지고 있다. 특히 VLM, VLA, 강화학습과 같은 AI 기술이 로보틱스와 결합하면서 매니퓰레이터와 휴머노이드를 활용한 연구가 빠르게 발전하고 있다. 이러한 흐름에 따라 많은 사람이 로보틱스 연구와 개발을 시작하려고 하지만, 방대한 이론과 복잡한 개발 환경, 부족한 구현 자료 때문에 어디서부터 시작해야 할지 어려움을 느끼는 경우가 많다. 논문을 읽어도 실제 코드와 연결하기 어렵고, 설치부터 실행까지 수많은 오류와 시행착오를 마주하게 된다. 나 역시 공부..
0. 시작하기 전에이전 포스팅에서는 객체 탐지를 위한 DINO와 Grounding DINO에 대해 다루어 보았다면, 이번에는 Vision-Language Model(VLM)에서 한 걸음 더 나아가 비전과 행동(Action)을 결합하여 로봇의 자율주행 경로를 계획하는 흥미로운 논문, Navigation World Models (NWM)에 대해 리뷰하려고 한다. 앞으로도, VLM과 VLA 그리고 World model을 섞어가면서 리뷰, 구현해볼 예정이다. 실제 환경에서 움직이는 자율주행 로봇은 예상치 못한 장애물이나 새로운 규칙에 직면하기 마련인데, 이 논문은 그러한 제약사항들을 유연하게 해결할 수 있는 차세대 내비게이션 접근법을 제시한다. 1. 기존 Navigation 모델의 한계와 NWM의 등장기존의 최..
이후 Grounding DINO(현재 사용하고 있는) 논문을 리뷰하기 위해, Vision-language model(VLM)은 아니지만, 최근 많은 사람들이 사용하고 있는 Object Detection 논문이다. 이 논문을 알고 있다면, 앞으로 리뷰할 논문에 대해서 편하게 이해할 수 있다.DINO: Grounded Language-Image Pre-training DINO: Detr with Improved DeNoising Anchor Boxes for End-to-End Object Detection DINO는 DETR(Detection Transformer, 순서가 살짝 꼬였지만 이후 보는 사람은다음을 참고하자.) 구조에 기반하여 object detection 성능을 향상시킨 방식이다. DINO가 ..
자율주행 분야란?2024.01.18 - [일상 이야기] - 로봇공학과를 선택한 이유, 로봇공학과란?을 이어서 이번엔 자율주행 분야에 대해서 말해보려고 합니다. GPT와 같은 생성형 Ai와 함께 가장 핫한 주제 중 하나죠? 자율주행은 운전자가 직접 조작하지 않아도 주행환경을 인식해 위험을 판단하고 최적의 주행 경로를 계획해 스스로 주행하는 시스템을 말해요.자율주행에는 5가지의 단계가 있는데요, 현재 자율주행 기술은 어느 정도까지 왔을까요? 테슬라의 FSD(Full Self-Driving), 구글 웨이모(Waymo), 그리고 여러 자동차 제조사들이 개발 중인 자율주행 시스템을 보면, 우리가 기대하는 완전한 자율주행(Level 5)까지는 아직 시간이 필요해요. 현재 가장 발전한 수준은 Level 3~4 정도로..
GLIP(Grounded Language-Image Pre-training)은 CLIP과 함께 VLM의 기초가 되는 논문입니다. 이 논문은 CLIP에 대해서 알고 있다는 가정 하에 쉽게 이해할 수 있으니, 아직 CLIP이 익숙하지 않은 사람은 다음 블로그를 참고하는 것이 도움이 될 것이다. [논문 리뷰] VLM 돌파하기 - CLIP: Learning Transferable Visual Models from Natural Language SupervisionCLIP: Learning Transferable Visual Models from Natural Language Supervision 0. 시작하기 전에최근 DETR[End to End Detection]을 통해서 VLM을 이용한 객체 탐지[obje..
CLIP: Learning Transferable Visual Models from Natural Language Supervision 0. 시작하기 전에최근 DETR[End to End Detection]을 통해서 VLM을 이용한 객체 탐지[object detection]이 핫하다. 이 중 VLM의 시초라 할 수 있는 CLIP이라는 논문에 대해서 리뷰해 보았다.1. CLIP란?CLIP[Contrastive Language-Image Pre-training]은 OpenAI에서 제안한 모델로, 이미지와 텍스트 쌍을 통해 학습하는 대규모 학습 기법이다. 기존 이미지 분류 모델들은 고정된 범주를 예측하도록 학습되지만, CLIP은 훨씬 더 유연하게 동작한다. 인터넷에 있는 방대한 이미지-텍스트 쌍을 이용해 이미..
Transformer: Attention Is All You NeedTransformer는 자연어 처리[NLP] 분야에서 기존 순환 신경망[RNN]과 합성곱 신경망[CNN]의 한계를 극복하며 혁신적인 성과를 거둔 알고리즘이다. 이 모델은 2017년 논문 "Attention Is All You Need" 에서 처음 소개되었으며, 현재 GPT, BERT, T5 등 다양한 모델의 근간이 되고 있다.Transformer 란?Transformer는 기존 RNN 기반 모델과 달리 순차적인 연산 없이 병렬 처리가 가능하다는 점에서 큰 장점을 가진다. 이는 Self-Attention 메커니즘을 기반으로 작동하며, 문장 내 모든 단어 간의 관계를 한 번에 학습할 수 있도록 설계되었다.주요 개념은 다음과 같다:Self-A..
이전 문제점인 탐색 시간 [MST] 이 너무 높게 나오는 것을 파악하여 새로운 Reward 설계를 진행하였다.기존 논문과는 다르게 Reward 설계를 해서 새롭게 제시해 주었다. 생각보다 성능과 탐색 시간 모두 이전에 뽑았던 성능들보다 우수하게 나와서 좋았다.논문 제출일이 13일 남았으니까 빠르게 써보자!
이전 일기 이후로, 해결했다는 생각에 기뻐서 열심히 결과값들을 뽑았다.내 생각보다 둘 다 성능이 좋아 놀랐지만, 드디어 코드를 다 짰다! 라는 생각에 행복했던 것 같다. 결과를 뽑고 나니 새로운 문제가 생겼다.RRT는 Random 한 Tree 구조를 가지기에 목적지까지의 거리를 Reward로 함께 받는다. 이로 인하여 목적지 까지 빨리 가려고 하는 성질이 생겨, 목적지 까지 도착하는 데 걸린 시간인 MST$(Mean Search Time)$이 MCTS 보다 낮게 나오게 되었다. 이게 문제가 되는 것이, STE 문제에서는 빠르게, 정확하게 목적지를 찾는 게 목표라서정확하게 찾는 것은 MCTS가 낫지만, 빠르게 찾는 것이 RRT가 더 우수하게 나오고 있는 것이었다. 그래서 Baseline 코드는 유지한 채,..