이어서 또 VLM 논문.VLM 정말 재밌다. 뭔가 지금 모든 게 밝혀진 상태가 아니라서 그런지, 재밌게 연구할 분야가 무궁무진한 느낌이다. CVPR 2026 논문이다.https://vlm-mirage.github.io/static/pdfs/mirage_arxiv.pdf AbstractVLM은 멀티모달 이해 능력이 뛰어나지만 출력하는 과정에서는 텍스트만 생성하기 때문에 시각적인 추론 과정도 모두 언어로 표현해야 한다. 그래서 시각적 상상(visual imagination)이 필요한 문제에서는 성능이 비교적 안 나올 수 있다.최근 연구들에서는 VLM이 실제 이미지를 생성하도록 학습시키기도 하지만, 이때 이미지 생성 사전학습이 필요하고(heavy함) 이게 오히려 추론 능력을 방해하는 경우가 있다. 그래서 인간..