전체 글 16

YOLO를 활용한 횡단보도 보행자 보호 시스템 (1)

교차로에서 우회전하는 차량 운전자의 부주의로 인해 교차로 횡단보도를 건너는 사람이 다치는 사고가 자주 발생한다고 한다.2022년 이를 완화하고자 교차로에서 차량이 우회전할 때 횡단보도를 미리 확인하게 하는 방법을 고안했다. 횡단보도만을 촬영하는 CCTV가 CCTV가 비추고 있는 화면을 우회전하려는 차량 운전자에 보이도록 하여, 횡단보도를 보여주고 동시에 횡단보도에 사람이 건너려고 하는 경우 사람이 있다는 것을 보여준다.이를 통해 교차로에서 발생하는 보행자 사고를 감소시키고자 한다. 보행자 감지 위해 객체 인식 알고리즘으로 YOLOv5와 YOLOv7을 사용하고자 한다.새롭게 진행하고자 하는 YOLO 사람 인지 CCTV 추론은 크게 1. 카메라 프레임 읽기2. YOLO 모델로 영상 분석3-1. 사람 감..

SSD 사물 인지 CCTV - 객체 인식 네트워크 이용한 사람, 차, 버스 인지(2)

본격적으로 SSD MobileNet v1 학습을 시작한다. 먼저, MobileNet v1에서 훈련을 시작하였다. !python3 /content/drive/MyDrive/SSD/pytorch-ssd/train_ssd.py --data=/content/drive/MyDrive/SSD/pytorch-ssd/data/cctv --model-dir=/content/drive/MyDrive/SSD/pytorch-ssd/data/cctv --batch-size=16 --epochs=35 * 경로 지정 오류로 인해 파일 불러오기가 불가능했다. 경로 지정 주의하자 train_ssd.py 파일은 다음과 같다.import osimport sysimport loggingimport argparseimport datetime..

SSD 사물인지 CCTV- 객체 인식 네트워크 이용한 사람, 차, 버스 인지(1)

SSD 사물인지 CCTV 추론을 활용하여 객체 인식을 통한 사람, 차, 버스를 인지하고자 한다. SSD 사물 인지 CCTV 추론은 기본적으로 카메라 프레임 읽기 -> SSD 모델로 영상분석 -> 사물 감지 과정으로 시작이 된다.사물 감지 과정에서 사물 감지가 된 경우에는 감지결과(사람, 차, 버스) 바운딩 박스를 표시하고, 카메라 영상을 디스플레이한다.반대로 사물 감지가 되지 않은 경우 계속해서 카메라 영상을 디스플레이 한다. 이에 추가적으로 구체적으로 몇 월 몇 일 몇 시에 감지가 되어 있는지를 확인하기 위해 사물 감지가 되었을 때 인식 결과를 바운딩 박스로 표시하기 전에 감지한 시간과 같은 관련된 정보를 로깅하는 부분을 추가하고자 한다. 1. 실습 준비 1-1. 구글 드라이브 구성 및 소스 코드 다운..

Fully Convolutional Networks for Semantic Segmentation 논문 리뷰

책으로 이미지 분할에 대해 학습하면서, FCN 이미지 분할에 대해 학습하였다.책에서 나온 FCN 모델에 대해 더 자세히 알고 싶어 FCN 논문을 읽어보았다.그에 앞서 가장 기본적인 근간이 되는 이미지 분할과 FCN이 무엇인지를 먼저 알아보았다. 🧩 이미지 분할 ( Image Segmentation ) 이란?: 이미지 내의 각 픽셀에 대해 레이블을 지정하는 작업으로, 어디에 무엇이 있는지를 픽셀 단위로 파악이 가능하다. 📁 이미지 분할의 종류1. Semantic Segmentation : 같은 클래스는 동일한 색으로2. Instance Segmentation : 같은 클래스라도 그 안에서 각 객체를 구분함3. Panoptic Segmentation : Semantic + Instance 📍이미지 분..

예지의 추가공부 정리 시작 !

요즘 ' 실전! 프로젝트로 배우는 딥러닝 컴퓨터비전 ' 이라는 책으로 2025.7.1부터 딥러닝 영상인식에 대해 혼자서 공부하고 있다. 딥러닝 영상인식 자체가 생소한 건 절대 네버 아니지만, 자율주행 관련해서 관심이 생긴 만큼 좀 더 이론적인 부분과 모델 아키텍처의 원리에 대해 알아보고 나중에는 실제로 자율주행 관련해서 실습이나 프로젝트, 더 나아가 실무도 경험해보고 싶은 꿈을 가지게 되었고 방학을 의미없이 보내기는 싫어서 ( 사실 4학년이라 의미없이 보내면 안됨. ㅋ ) 공부하면서 같이 정리해보면 좋을 것 같은 내용들을 써보자한다. 나중에 정리해놓은 내용들 보면 일단 너무 뿌듯할 듯 ㅎㅎ >> ' 실전! 프로젝트로 배우는 딥러닝 컴퓨터비전 ' 이라는 책은 기본 이론들, 관련 코드 실습, 프로젝트 실..

Encoder-Decoder with Atrous Separable Convolution for Semantic Image Segmentation 논문 리뷰

UNet, Deeplabv3+, Segformer 이 3가지의 모델이 Segmentation 분야에서 가장 많이 사용되고, 중요한 모델이다.우리 3명이 각각 1개씩 모델을 맡아서 논문을 읽고 서로 설명해주기로 하였다.내가 맡은 논문은 Deeplabv3+ 모델로 UNet과 Segformer 사이에서 발행된 논문이지만, 나름 무시할 수 없는 중요한 모델이다.오늘은 이 Deeplabv3+ 모델에 대해 살펴보려고 한다. 논문 제목 : Encoder-Decoder with Atrous Separable Convolution for Semantic Image Segmentationhttps://arxiv.org/pdf/1802.02611저자 : Liang-Chieh Chen, Yukun Zhu, George Pap..

방학프로젝트 시작 !! 2025.6.24~

2025. 6.24지난 1학기 동안에 열심히 읽어온 AI 모델들 논문 바탕으로 방학에는 프로젝트를 같이 진행하게 되었다!각자 하고 싶은 프로젝트 주제 생각해와서 투표로 주제를 정했는데 운이 정말 좋게도 내 주제랑 효민이 주제가 같이 뽑히게 되었다 !! 주제가 어쩌다가 뽑히게 되어서 조장까지 되어버렸지만...내 주제 아가를 위해, 주제 같이 하게된 은체랑 나현언니를 위해 열심히 으쌰으쌰 해보겠따..! ( 나 마음 먹어버렸으. ) 나 자신 방학 동안 홧팅! 은체랑 나현언니도 홧팅 ! 이 카테고리는 방학프로젝트 기록용으로 만들어보았닷 ( 정리해두자는 걸 그만 프로젝트 시작하고 나서야... 읍읍 앞으로는 일주일 단위로 기록하기로 맹세! )

[Euron] 13week_You Only Look Once : Unified, Real-Tme Object Detection

0. Abstract 기존의 객체 탐지 방식들은 분류기를 재활용하여 탐지를 수행하였다.그러나 본 논문에서 제안하는 YOLO는 객체를 탐지할 때 공간적으로 분리된 바운딩 박스와 관련된 클래스 확률로의 회귀 문제로 보고, 단일 신경망이 전체 이미지로부터 바운딩 박스와 클래스 확률을 직접 한 번에 예측 가능하게 한다. 전체 탐지 파이프라인은 1개의 네트워크로 경우에 따라 탐지 성능을 최적화 가능하다.YOLO는 속도 측면에서 매우 빠르고 mAP도 기존의 방식들과 비교하였을 때 2배 정도 높다. 위치 오류는 많이 생성하나, 배경에 대하여 탐지를 잘못하는 경우는 상대적으로 적다. YOLO는 객체에 대해 매우 일반화된 표현을 학습하고, 이로 인해 다른 모델들보다 일반화 측면에서 더 나은 성능을 가진다. 1. Intr..

[Euron] AI모델 2025.06.01

[Euron] 12Week_ BLIP : Bootstrapping Language-Image Pre-training forUnified Vision-Language Understanding and Generation

1. 논문 : BLIP: Bootstrapping Language-Image Pre-training for Unified Vision-Language Understanding and Generation2. 저자 : Junnan Li, Dongxu Li, Caiming Xiong, Steven Hoi, Salesforce Research3. 링크 : https://arxiv.org/pdf/2201.12086 0. Abstract VLP는 다양한 시각-언어 작업들에 성능 향상을 이끌어냈다.그러나, VLP는1. 이해 기반의 과제와 생성 기반의 과제 둘 중 하나의 과제에서만 성능 향상을 이끌어낸다.2. 대부분 웹에서 수집한 노이즈가 많은 이미지-텍스트 쌍으로 구성된 대규모 데이터셋을 사용하기 때문에 최적의 방..

[Euron] AI모델 2025.05.25

[Euron] 11week_ Swin Transformer

0. Abstract 본 논문은 Swin Transformer라는 새로운 vision Transformer를 제시한다. Transformer를 언어부터 비전까지 적용하는 과정에서, 2개의 도메인들 간의 차이에 의해 ( 시각 이미지의 크기와 단어들과 비교되는 이미지 픽셀들의 고차원 해상도 ) 발생하는 문제들이 생겼다. 이러한 차이들을 해결하기 위해, shifted windows로 계산되는 계층적 Transformer를 제안한다.Shifted Windows 방식은 self-attention 계산 시 겹치지 않는 local window로 제한되어 효율성을 높이는 동시에, 서로 다른 window간의 연결도 허용한다. 이러한 계층적 아키텍처는 다양한 스케일에서 모델링할 수 있는 유연성을 가지며, 이미지 크기에 ..

[Euron] AI모델 2025.05.18