VLM 구조 파악 및 영상/생성 AI 워크플로우 탐색
VLM에서 CLIP 텐서가 이미지 조각(patch)을 어떻게 처리하는지 뜯어봄. DeepStream SDK 데모 만들면서 영상 파이프라인 맛보고, ComfyUI로 Wan2.1 2D 워크플로우 구현 시도함. Godot 푸드트럭 프로젝트도 중간중간 건드림. AI 모델 구조부터 영상 처리까지 다방면으로 삽질함.
이 날의 포인트
- CLIP 텐서 차원과 이미지 패치 분할 원리 파악
- NVIDIA DeepStream SDK 데모 구현 시도
- ComfyUI 기반 Wan2.1 2D 픽셀 툴킷 워크플로우 설계
세션별로 뭘 시켰나 (4개)
-home-son-prj-godot-foodtruck
claude
00:03 — 14:14
693개 메시지
ㅇㅇ
-home-son-prj-small-vlm
claude
08:14 — 14:12
649개 메시지
부품을 통과하며 변하는 숫자 묶음(텐서)의 '모양' CLIP 출력 [1, 50, 768] 사진을 50조각으로 나눠 각 조각을 768개 숫자로 표현 이런거에서 실제 사진이 50조각으로 어떻게 나뉘는지 같은것도 적어줘
-home-son-prj-deepstream
claude
09:33 — 12:30
301개 메시지
nvidia deepstream sdk를 사용해보고싶어. 간단한 데모 만들어줄수있어?
-home-son-prj-ComfyUI
claude
09:58 — 14:10
202개 메시지
https://civitai.com/models/1656375/wan212d-pixel-toolkit-2d 의 내용 workflow로 구현해줘.