전체 글

Hi🖐️ I'm interested in MultiModal & PromptLearning and dreaming of becoming a Data Scientist!
이번 글에서는 LoRA를 이용하여 StableDiffusion을 FineTuning하는 법에 대해 포스팅하고자 한다!LoRALow-Rank Adaptation of Large Language Models(LoRA)는 pretrained 모델의 weights를 고정하고, 그 위에 새로운 task를 위한 weights를 추가하는 방식으로 fine tuning을 진행한다.이 방식은 Trainable한 parameter의 수를 크게 줄여, 기존의 fine tuning 방식보다 훨씬 빠르다.또한, 기존의 fine tuning 방식은 모든 weights를 업데이트하는데 반해, LoRA는 일부 weights만 업데이트하기 때문에, 기존의 fine tuning 방식보다 더 적은 양의 데이터로 fine tuning을 할..
논문 링크 : https://arxiv.org/abs/2006.16228 BackGroud 기존 연구들의 한계점을 살펴보자. 모달리티 간의 관계를 충분히 고려하지 않음 이전 연구들은 종종 시각, 음향, 언어 등의 다중 모달 데이터를 독립적으로 처리하거나 제한적인 방식으로만 고려하여 모달리티 간의 복잡한 상호작용을 충분히 반영하지 못했다. 성능 제한 기존 다중 모달 학습 방법은 종종 성능이 한정되거나 일부 모달리티에 치우친 결과를 얻는 경우가 있었으며, 다양한 모달리티 간의 상호작용을 고려한 효과적인 표현 학습이 부족했다. 모달리티 간의 특성 미고려 기존 연구들은 종종 시각, 음향, 언어 등의 모달리티 간의 특성과 세부적인 차이를 고려하지 않고 일반적인 방식으로 다루어서 세밀한 표현을 유지하기 어려웠다. ..
논문 링크 : https://arxiv.org/abs/1412.6622 Triplet Network Triplet Network에서는 facenet과 같이 3개의 데이터가 입력으로 주어짐. X : anchor X- : anchor와 일치하지 않는 입력 X+ : anchor와 같은 클래스에 해당하는 입력 값 이 세개의 인스턴스는 각각 동일한 weight를 공유하고 있는 feed forward 네트워크(샴 네트워크)에 들어가게 된다. 여기서 잠깐, Siamese Network(샴 네트워크)에서 “샴’은 샴쌍둥이에서 유래된 것으로, 즉, weight를 공유하는 두 네트워크로 이루어진 네트워크를 의미한다. 왼쪽 사진처럼 Weight를 공유하는 두개의 네크워크를 샴 네트워크라고 하는데 어차피 weight를 공유하..
논문 : https://arxiv.org/pdf/2305.05665.pdf Key Point pair가 존재하지 않는 데이터를 이미지를 통해 정렬하여 (I,M1), (I,M2)에 대해 (M1,M2)가 정렬되어 각각의 모달리티와 이미지를 정렬하는 것이 서로 다른 모달리티도 정렬되는 현상을 발견 제안 방법론 본 논문의 모델 IMAGEBIND는 6가지 각 modalities를 하나의 representation space에서 표현하는 것이 목표이다. 이러한 시도는 CLIP이 가장 유명한 연구 중 하나인데, 원래는 이미지와 텍스트는 각기 다른 space에 존재하기 때문에 서로 관계를 측정할 수가 없었다. 하지만, CLIP에서 해당 데이터들을, 즉 이미지와 텍스트를 Joint Embedding Space에 보내 유..
CLIP 논문을 읽고 핵심 내용만 정리함. 논문 링크: https://arxiv.org/abs/2103.00020 모델 등장 배경 Vision Model은 전통적으로 이미지를 입력받아 어떻게 모델을 구성하면 더 좋은 표현을 학습하는지를 고민해왔으며, 그덕분에 날이 갈수록 발전함. 하지만 이미지만 학습한 모델은 고질적으로 일반화 능력이 부족하고 작은 노이즈에도 취약한 약점을 보임. 한편 Language Model은 Vision Model 보다 한 발 앞서 나아가는 형태로 발전 이에, “Vision Model도 LLM과 같은 방향으로 간다면 한 단계 더 발전할 수 있지 않을까?”라는 고민을 하게 되고, “데이터셋이라도 아주 크게 만들어서 학습한다면 지금의 Vision Model의 한계를 넘어설 수 있지 않을..
수행기간 2023-04 ~ 2023-11 깃헙 : https://github.com/pej0918/E-yes GitHub - pej0918/E-yes: 👁️ 2023한이음프로젝트 : 시각장애인 교육용 점자 번역 및 문서 요약 시스템 👁️ 2023한이음프로젝트 : 시각장애인 교육용 점자 번역 및 문서 요약 시스템 개발 (은상 수상)👁️ - GitHub - pej0918/E-yes: 👁️ 2023한이음프로젝트 : 시각장애인 교육용 점자 번역 및 문서 요약 github.com 🔍 목차 프로젝트 개요 프로젝트 진행과정 프로젝트를 마치며 1. 프로젝트 개요 ☑️ 1.1. 프로젝트 소개 본 프로젝트는 시각장애인들이 영어 점자 서적을 쉽게 학습할 수 있도록, 영어 점자를 한글로 번역하고 오디오 파일로 생성해주는 기능..
· ❓Issue
안녕하세요! 이번에는 KOTE_pytorch_lightning 오류 해결에 대한 포스팅을 하겠습니다! 이번 학기에 기계학습 수업을 들으면서 KOTE데이터셋을 이용해야 하는 일이 생겼는데요! https://github.com/searle-j/KOTE GitHub - searle-j/KOTE: Korean Online That-gul Emotions Dataset Korean Online That-gul Emotions Dataset. Contribute to searle-j/KOTE development by creating an account on GitHub. github.com 위 깃허브에서 제공한 코드 그대로 실행시키니 아래와 같은 오류가 발생했습니다 NotImplementedError: Suppo..
1탄에 이어서 2탄으로 돌아왔습니다,, https://pej2834.tistory.com/31 KoBERT로 다중 감정 분류 성능 개선을 위한 FineTuning 도전, 1탄 사용자 일기에 대한 다중 감정 분류를 진행하기 위해 KoBERT 파인튜닝 과정을 기록하겠습니다!✍️✍️ KoBERT모델을 아래 공식 링크를 참고하여 불러오면 됩니다. https://github.com/SKTBrain/KoBERT GitHub - pej2834.tistory.com 1탄에서 많은 삽질을 했었는데요... 2탄에서는 드디어!!!!!! KoBERT모델 성능을 개선했습니다!!!🔥🔥 1탄에서 사용한 데이터셋 이외에 또 다른 데이터셋을 추가하여 모델 학습을 진행했습니다. 추가 학습 데이터로는 아래 데이터를 사용했는데요! http..
Ju_pyter
쭈의 공부기록