← 전체 날짜로
2026-05-28 exploring

VLM 구조 파악 및 영상/생성 AI 워크플로우 탐색

VLM에서 CLIP 텐서가 이미지 조각(patch)을 어떻게 처리하는지 뜯어봄. DeepStream SDK 데모 만들면서 영상 파이프라인 맛보고, ComfyUI로 Wan2.1 2D 워크플로우 구현 시도함. Godot 푸드트럭 프로젝트도 중간중간 건드림. AI 모델 구조부터 영상 처리까지 다방면으로 삽질함.

이 날의 포인트

  • CLIP 텐서 차원과 이미지 패치 분할 원리 파악
  • NVIDIA DeepStream SDK 데모 구현 시도
  • ComfyUI 기반 Wan2.1 2D 픽셀 툴킷 워크플로우 설계

세션별로 뭘 시켰나 (4개)

-home-son-prj-godot-foodtruck claude 00:03 — 14:14 693개 메시지

ㅇㅇ

-home-son-prj-small-vlm claude 08:14 — 14:12 649개 메시지

부품을 통과하며 변하는 숫자 묶음(텐서)의 '모양' CLIP 출력 [1, 50, 768] 사진을 50조각으로 나눠 각 조각을 768개 숫자로 표현 이런거에서 실제 사진이 50조각으로 어떻게 나뉘는지 같은것도 적어줘

-home-son-prj-deepstream claude 09:33 — 12:30 301개 메시지

nvidia deepstream sdk를 사용해보고싶어. 간단한 데모 만들어줄수있어?

-home-son-prj-ComfyUI claude 09:58 — 14:10 202개 메시지

https://civitai.com/models/1656375/wan212d-pixel-toolkit-2d 의 내용 workflow로 구현해줘.