728x90

전체 글 103

[경진대회] 제 6회 대구광역시 빅데이터분석 경진대회 - 회고록

이 글은 발표까지 다한 상태로 10월달에 있을 결과 전 회고록이다. 발표자료인 ppt를 통해서 발표를 줌에서 하는데 10분 내외로 알려진 발표 시간이 10분임을 발표 직전에 정확히 알게되었다. 나는 연습을 할 때 12분 짜리 발표였다. 그래서 말을 더 빠르게, 필요없는 부분은 삭제를 하고 발표를 했다. 우리는 에너지 관련해서 프로젝트를 진행했고 데이터를 다루다 보니 엄청 섬세한 부분까지 도달하지 못했다.통계처리로 동네별, 1년별, 월별 등 데이터가 크게크게 있다보니 섬세하게 하루 사용량 등을 인지하기 못했다. 발표 후 질문으로 연관성이 많이 떨어진 느낌인 것과 너무 추상적이다라는 평을 받게 되었다. 아쉽지만 그래도 최대한으로 했기에 이보다 더 할 수는 있지만 돌아간다면 이만큼이 최대일 것 같다. 발표는 ..

경진대회 2024.09.14

[DACON] 새싹 해커톤 - 예선 회고록

파이널 프로젝트인 밀땅을 재사용할 목적으로 대회에 참가 및 제안서를 만들었다.  https://dacon.io/competitions/official/236293/codeshare/11310?page=1&dtype=random 꿈나무들을 위한 건강 관리 서비스 - H.O.T(Happy Our Tree 행복한 우리의 나무)새싹 해커톤 예선 (모집마감 7.12. 18:00)dacon.io 주제는 꿈나무들(결식 아동)을 위해 영양 관리를 도와주고 꿈나무 가맹점을 쉽게 찾고 메뉴를 통한 검색이 가능한 웹 서비스를 계획 했었다. 하지만 평가위원의 선택을 받지 못해 88등으로 50등 안에 들지 못해 탈락했다.구현 가능성을 최대한으로 생각하다 보니 가지고 있는 카드 안에서 활용했던 것과 신박한 아이디어가 아니였던 것..

경진대회 2024.07.31

[DACON] 새싹 해커톤 - 예선 준비

새싹 해커톤이란?IT 기술 분야에 관심있는 기획자, 디자이너, 개발자 청년들이 모여 서울의 미래를 바꿀 아이디어를 기획하고 서비스로 구현하는 해커톤입니다. 서울시 SW 교육 브랜드 청년취업사관학교(SeSAC)와 기획하고 운영합니다.- 예선 평가 기간 : 2024년 07월 22일 (월) 10:00 ~ 7월 26일 (금) 오전 10:00- 예선 결과 발표일 : 2024년 7월 26일 (금) 오전 10:00- 해커톤 본선 일정 : 2024년 8월 1일 (목) ~ 8월 2일 (금)[주제]생성형 AI를 활용한 약자와의 동행사회적 약자의 문제의 해결을 방점으로 하며, 생성형 AI의 활용은 관련만 있으면 활용한 것으로 간주됩니다. 위 대회를 참가하기로 마음을 먹었다. 주제를 선정하기 위해 고민을 하고 있지만 생성형..

경진대회 2024.07.12

[DACON] 데이콘 빅데이터 분석 경진대회 - 에너지 부문

https://dacon.io/competitions/official/236285/codeshare/11208?page=1&dtype=random 전기사용량의 감소를 목표로 맞춤형 복지 형성을 위한 분석에너지 부문dacon.io 팀 우왕좌왕으로 나갔다. 아이디어를 떠올리고 데이터를 찾는데만 일주일이 넘게 걸렸다. 하려고 하면 이미 해본 경우가 있고 아니면 데이터를 찾을 수 없어서 아이디어만 5번은 바꾼 것 같다. 전기사용량은 여러 요인에 걸쳐서 발생하는 것 같았다.쉽게 생각해보면 전자제품 갯수에 따라서 다를 것이고 집 크기에 따라서도 다를 것이다.  아이디어 부문에서 제출을 했지만 예선 통과시 본선에서 직접 데이터들을 분석해야하는데 얼마나 유의미한 결과를 내보일진 모르겠다. 만약 이 글을 본다면 들어가서..

경진대회 2024.07.09

[빅분기] 제 3유형 연습

제 3유형 같은 경우 제일 많이 나온 것은 카이제곱, pvalue, t분포 등 통계량에 대한 것이다.또한 회귀 문제로 회귀계수, pvalue값, 오즈비, 잔차 이탈  등을 구한다.  - 샤피로 검정을 통해 표본이 정규 분포에서 추출 된 것인지 확인 유의 수준이 5%일 때 pvalue값을 확인from scipy.stats import shapiroprint(shapiro(df)) - 카이제곱 독립성 검정 : 유의 수준이 5%일 때 pvalue값을 확인from scipy.stats import chi2_contingency# 데이터 배열 생성 (빈도로 변환)data = np.array([[do_male, dont_do_male], [do_female, dont_do_female]])# 카이제곱 검정 수행ch..

[빅분기] 제 1유형 연습

빅데이터분석기사 같은 경우 1유형에는 여러 유형의 문제가 있다. 중요도 순서 상관없이 생각 나는데로 정리 해보았다. - 데이터의 count, mean, std, min, 1/4, 2/4, 3/4, max 값이 출력되는 것df.describe() - IQRq1 = df['target'].quantile(1/4)q3 = df['target'].quantile(3/4)iqr = q3 - q1min = q1 - 1.5*iqrmax = q3 + 1.5*iqrprint(len(df[(df['target']>min) | (df['target'] - zscorefrom scipy.stats import zscoresub = '목표 column'result = zscore(df[sub].dropna()).max() - ..

[빅분기] 제 2유형 연습

제 2유형은 모델을 직접 train하고 결과를 제출해야한다.타이타닉으로 연습했고 필요로 할 때 수정할 수 있게 했다.RandomForest 같은 경우 Onehotencoding을 하지 않아도 성능이 나오기 때문에 모델은 RandomForest로 했고Encoding 같은 경우 Onehot을 할 필요가 없으니 LabelEncoder를 사용했다.  Classifier가 나오면 RandomForestClassifierregressor가 나오면 RandomForestRegressor로 바꿀 전략을 취했고 import sklearnhelp(sklearn)을 활용했다.import pandas as pdimport numpy as npimport seaborn as snsfrom sklearn.ensemble impo..

[DP] DP에 대해서 알아보자

DP는 Dynamic Programming(동적 계획법)으로 복잡한 문제를 더 작은 하위 문제로 만들어 계산해 위로 올라가는 방식이다.  개념은 재귀와 비슷하지만 재귀는 하향식, DP는 상향식이다. 즉 중복되는 계산을 저장하면서 올라가다보니 한번의 계산 후에 결과들을 저장하고 불러오는 형식이다. 또 최적의 값을 찾을 때도 사용한다.  문제를 풀기 위해서 메모와 점화식이 중요하다. 대표적인 문제는 피보나치 수열, 배낭 문제, 최단 경로, 최장 증가 부분, 문자열 편집 거리 등이 있다. DP의 장점은 중복 계산을 피할 수 있고 시간복잡도가 효율적이게 된다.하지만 단점으론 메모리 사용량이 상대적으로 크다. https://www.acmicpc.net/problem/9461  #include #include us..

Algorithm 2024.06.03

[AI] 자연어처리

1) 자연어란? 우리가 일상 생활에서 사용하는 언어2) 컴퓨터가 자연어의 의미를 분석하여 처리하는 것을 자연어 처리(Natural Language Processing)라 한다.3) 자연어 처리는 음성 인식을 바탕으로 번역, 내용 요약, 감성분석, 텍스트 분류 작업 그리고 챗봇으로 사용되는 기술임4) 최근 딥러닝을 통해 성과를 얻었으며 AI 분야에서 실질적으로 성과를 보이는 분야이다.  활용 기술- Anaconda (Numpy, Pandas, scikit-learn, matplotlib, seaborn, nltk)- Tensorflow : 구글이 2015년에 공개한 머신 러닝 오픈소스 라이브러리, 머신 러닝과 딥 러닝을 직관적이고 손쉽게 할 수 있도록 설계 - keras : 딥 러닝 프레임워크인 텐서플로우..

AI 2024.05.29
728x90