728x90

전체 글 179

궁금해서 공부하는 추천시스템 Multimodal Recommendation System 2

멀티모달을 붙이면 단순히 “이미지 입력도 받는다” 수준보다 훨씬 다양하게 쓴다. 최근 멀티모달 추천 시스템은 텍스트·이미지·행동 로그·구조화 데이터 같은 이질적인 정보를 함께 이용해 user/item representation을 풍부하게 만드는 방향이 핵심이다. https://arxiv.org/pdf/2505.09777 예를 들어 사용자가 사진을 하나 올리고:“이런 느낌인데 비 오는 날 입을 수 있고 20만원 이하인 거 추천해줘.”라고 한다고 해보자.그럼 구조는 이렇게 될 수 있다.사용자 이미지 ↓VLM ↓Visual Preference- black- minimal- oversized- outdoor │ │사용자 텍스트"비 오는 날 / 20만원 이하" │ ..

NLP/이론 2026.08.10

궁금해서 공부하는 추천 시스템 Recommendation System1

Retrieval → 1st-stage Ranking → 2nd-stage Ranking → Final Re-ranking의 다단계 구조를 사용하고 있고, 최근에는 그 안에 sequence model이나 LLM 계열 모델이 들어가는 방향으로 발전중사용자 행동 데이터 (click / view / purchase / like / dwell time) ↓ Feature 생성 ↓ ① Candidate Retrieval 수백만 개 → 수백/수천 개 ↓ ② Ranking 수백/수천 개 → 수십 개 ↓ ③ Re-ranking 다양성 / 중복 / 비즈니스 룰 반영 ↓ ④ 사용자에게 노출 ↓ ..

NLP/기타 2026.08.10

[Quantization] 내가 양자화를 공부할 줄이야 - 양자화 기본 이론/개념 정리 AWQ/GPTQ/NF4

근래에 AWQ, NF4 논문들을 보면서 자꾸 같이 언급되는 개념이나 단어들을 공부용으로 적어놓고자... https://joannekim0420.tistory.com/187 [논문 리뷰] QLoRA: Efficient Finetuning of Quantized LLMs이 논문을 이해하기 위해서는 LoRA의 개념에 대해서 먼저 공부해야한다. https://joannekim0420.tistory.com/186 LoRA : Low Rank Adapter 그래서 LoRA 가 뭔데?사실 LoRA 는 2021년에 나왔지만 내 기억에는 거의 2023년joannekim0420.tistory.comhttps://joannekim0420.tistory.com/186 LoRA : Low Rank Adapter 그래서 LoR..

NLP/이론 2026.07.23

[멀티모달] 양자화 모델 성능 실험 Experiment on Quantized Multimodal Models

Experiment SettingsVideo # : 649 클립GPU : RTX 6000 Ada 47.7 GiBBatch size : 4fps : 1ResultconfigTop-1correctquant실행시간가중치peak allocpeak reserved2B bf1682.6%536/649bf166.7분4.7G13.5G16.6G2B NF480.6%523/649NF47.1분2.8G10.8G13.8G2B AWQ78.6%510/649int47.2분2.7G14.3G19.6G4B bf1679.5%516/649bf1610.2분9.3G20.3G24.5G4B NF480.3%521/649NF410.3분5.0G14.3G18.4G4B AWQ80.3%521/649int411.1분5.0G22.4G25.9G양자화는 가중치는 줄이지..

[논문 리뷰] QLoRA: Efficient Finetuning of Quantized LLMs

이 논문을 이해하기 위해서는 LoRA의 개념에 대해서 먼저 공부해야한다. https://joannekim0420.tistory.com/186 LoRA : Low Rank Adapter 그래서 LoRA 가 뭔데?사실 LoRA 는 2021년에 나왔지만 내 기억에는 거의 2023년부터 널리 사용된 것 같다. 이 글은 LoRA 의 논문을 리뷰하기보다는 단순히 글로는 이해되지 않는 부분들을 GPT 와 함께 실제 LoRA의 의미와 사joannekim0420.tistory.com 논문 : https://arxiv.org/pdf/2305.14314 2 BackgroundBlock-wise k-bit Quantization일반적인 k-bit quantization은 입력 중 asbmax 값으로 나누어 quantizat..

NLP/이론 2026.07.21

LoRA : Low Rank Adapter 그래서 LoRA 가 뭔데?

사실 LoRA 는 2021년에 나왔지만 내 기억에는 거의 2023년부터 널리 사용된 것 같다. 이 글은 LoRA 의 논문을 리뷰하기보다는 단순히 글로는 이해되지 않는 부분들을 GPT 와 함께 실제 LoRA의 의미와 사용을 파악하기 위한 글이다. 논문 : https://arxiv.org/pdf/2106.09685 1. Low Rank Adapter 개념 원래의 weight는 고정하고,각 Linear Layer을 아주 적은 저차원(Low-Rank)행렬만 추가해 변화량만 학습하는 것. Full Finetuning 시 weight는 원래 크게 변하지 않는다. 따라서, weight 의 변화량은 매우 낮은 차원으로 충분히 표현할 수 있다. 원래 Transformer 에서의 LinerLyaer 는 Y = WX 라고..

NLP/이론 2026.07.20

LLM-Agent : Tool Calling

1. Tool Calling이란LLM에게 "네가 쓸 수 있는 함수 목록"을 알려주면, LLM이 텍스트 답변 대신"이 함수를 이 인자로 호출해줘" 라고 응답하는 기능.가장 중요한 한 문장: LLM은 함수를 실행하지 않는다.LLM은 "실행 요청"만 하고, 실행은 항상 내 코드가 한다.실행 결과를 다시 LLM에게 보여주면 그제서야 최종 답변을 만든다.도구는 두 부분으로 이뤄진다부분실체누가 보나실체평범한 파이썬 함수 get_visitor_count(date, floor)내 코드가 실행설명서JSON 스키마 (name, description, parameters)LLM이 읽고 언제·어떻게 쓸지 판단LLM은 설명서만 보고 판단한다 → description 품질 = 도구 선택 품질. 2. 왕복 흐름 (4단계)① 내 코..

NLP/이론 2026.07.08

LLM-ish Words

LLM 기반 코딩 에이전트들이 concocting, spelunking, percolating 같은 다소 낯선 단어를 자주 쓰는 이유는, 실제 개발 문화에서 쓰이는 은유적 표현을 학습했기 때문이다.예를 들어 spelunking through the codebase는 “낯선 코드베이스를 깊게 파고들며 살펴본다”는 의미로 개발자 커뮤니티에서 종종 쓰인다. wrangling dependencies, plumbing the API, scaffolding a project 같은 표현도 비슷하게 개발 문맥에서 사용된다.다만 LLM은 이런 표현을 사람보다 더 자주, 더 과장되게 사용하는 경향이 있다. 단순히 “확인 중”, “수정 중”, “구성 중”이라고 해도 될 상황에서 더 생동감 있고 agent처럼 보이는 단어를 ..

NLP/기타 2026.05.28

영상 해상도 비교

명칭해상도가로x세로총 픽셀수비고HD / 720p1280×720약 92만 화소0.92MP기본 HDFHD / Full HD / 1080p1920×1080약 207만 화소2.07MP일반 모니터, CCTV, 웹캠에서 많이 사용2K2048×1080 또는 2560×1440로 혼용약 221만 ~ 369만 화소2.2~3.7MP엄밀한 2K는 2048×1080, 제품에서는 QHD를 2K라고 부르기도 함QHD / WQHD / 1440p2560×1440약 369만 화소3.69MPFHD보다 약 1.78배 선명UHD / 4K UHD3840×2160약 829만 화소8.29MP일반 TV/모니터의 4KDCI 4K4096×2160약 885만 화소8.85MP영화/시네마 표준 쪽 4K5K5120×2880약 1475만 화소14.75MP고해상..

MultiModal/이론 2026.05.13

Positional Embedding의 변화2 - Multimodal Rotary Positional Embedding (MRoPE) 예시로 이해하기

Positional Embedding의 변화2 - Multimodal Rotary Positional Embedding (MRoPE) 예시로 이해하기 MRoPE를 이해하기 위해서 먼저 알고 있어야하는 것은 Positional Embedding과 Rotary Positional Embedding.Positional Embedding의 변화1편 - Rotary Positional Encoding (RoPE) 예시로 이해하기 은 https://joannekim0420.tistory.com/180 참고. 이전 글에서...Positional Embedding의 필요 이유와 Rotary Positional Embedding으로의 진화를 정리했다. 더 나아가 이번에는 Qwen2-VL: Enhancing Visio..

MultiModal/이론 2026.02.23
728x90