오늘 한 일
데이터 리터러시 완강
과제 - 배운 내용 간단 정리
1. 데이터 리터러시
데이터 리터러시란? :
데이터 수집과 데이터 원천을 이해하고
주어진 데이터에 대한 다양한 활용법을 이해하고
데이터를 통한 핵심지표를 이해하는
-> 올바른 질문을 던질 수 있도록 만들어줌
심슨의 역설(Simpson's Paradox) : 부분에서 성립한 대소관계가 그 부분들을 종합한 전체에 대해서는 성립하지 않는 모순적인 경우
-> 전체에 대한 결론이 언제나 개별 집단에 그대로 적용되는 것이 아님. 데이터에 기반한 결론이라고 해서 이를 맹목적으로 받아들여서는 안됨
샘플링 편향(Sampling Bias) : 전체를 대표하지 못하는 샘플 선정으로 인해 오류가 발생
-> 표본이 편향되면서 실제와는 다르게 해석하게 될 수 있다.
2. 문제 정의
문제 정의란? :
데이터 분석 프로젝트의 성공을 위한 초석
분석하려는 특정 상황이나 현상에 대한 명확하고 구체적인 진술
프로젝트의 목표를 설정하고 분석 방향을 설정
문제 정의 방법론
MECE(Mutually Exclusive, Collectively Exhaustive) : 문제 해결과 분석에서 널리 사용되는 접근방식. 문제를 상호 배타적이면서 전체적으로 포괄적인 구성요소로 나누는것 -> 복잡한 문제를 체계적으로 분해하고, 구조화된 방식으로 분석할 수 있음
로직 트리 : MECE 원칙을 기반으로 복잡한 문제를 더 작고 관리하기 쉬운 하위 문제로 분해하는 데 사용. 일반적으로 도표 형식으로 표현되어 쉽게 파악할 수 있음
문제정의를 하는 이유 : 풀고자 하는 것을 명확하게 정의하고, 이것을 해결하기 위한 데이터 분석의 방향성을 정하고, 결과를 정리하고 해석하여 더 나아지기 위한 새로운 액션 플랜을 수립하기 위함.
3. 데이터의 유형
정성적 데이터 : 비수치적인 정보로 사람의 경험, 관점, 태도와 같은 주관적인 요소 포함. 정형되지 않고 구조화 되어있지 않다. 새로운 현상이나 개념에 대한 이해를 심화하는 데 사용
정량적 데이터 : 수치적으로 표현되는 정보, 양적인 측정과 분석을 통해 얻을 수 있다. 데이터가 숫자 형태로 존재하기 때문에 통계적으로 분석하기 쉽다. 지표로 만들기에 용이함.
-> 비즈니스 목표를 위해서 두가지 데이터를 적절하게 활용하는 것이 필요.
4. 지표설정
지표란? :
특정 목표나 성과를 측정하기 위한 구체적이고 측정 가능한 기준
목표 달성도를 평가하고 전략적 결정에 필요한 핵심 정보를 제공
정의한 문제에 대해 정확하게 파악하기 위해서 필요
-> 문제 정의를 통해서 '어떤 문제를 풀고자 하는가?' 를 정의했다면, 지표는 '어떤 결과를 기대하는가?'에 대한 정량화된 기준.
주요 지표 :
- Active User(활성 유저)
-Retention Ratio(재방문율)
-Funnel(퍼널)
-LTV(Life Time Value, 고객 평생 가치)
5. 결론 도출
결과와 결론의 차이
결과 : 데이터 처리, 분석, 모델링 후에 얻어진 구체적인 데이터의 출력. 숫자, 통계, 그래프, 차트 등의 형태로 나타낼 수 있음
결론 : 분석된 데이터 결과를 바탕으로 이끌어낸 의미나 통찰. 데이터에 기반한 해석, 추론 또는 권고사항을 포함. 목적에 대해 어떤 의미가 있는지 설명하는 것.
-> 결과-결론 도출 시에는 스토리텔링이 필요
결국 데이터 리터러시란?
눈앞에 있는 데이터에 의존하지 않고 스스로 목적과 문제를 정의하는 것
그 목적을 달성하는데 필요한 데이터와 지표를 설정하는 것
데이터를 어떻게 봐야 문제의 정보를 효과적으로 얻을 수 있는지 분석하는 것
단순히 데이터를 보는 방식이나 분석 방법론, 통계 지식에 매몰되지 않는것
데이터 분석 파이썬 종합반 완강
개인과제 제출
레벨1
레벨 2
# 예시 데이터
numbers = [10, 20, 30, 40, 50]
def calculate_avg(numbers):
total = sum(numbers)
total_avg = total/len(numbers)
return total_avg
total_avg = calculate_avg(numbers)
print("숫자들의 평균:", total_avg)
간단한건데 헤맸음
-전체 합계를 total이라는 변수에 안넣고 함
def calculate_range_total(production_counts, min_value):
num = production_counts[0]
range_total = 0
for num in production_counts:
if num >= min_value:
range_total = range_total+ num
return range_total
# 예시 데이터
production_counts = [100, 150, 120, 130, 110, 180, 140]
range_total = calculate_range_total(production_counts, 110)
print("특정 수량 이상 생산한 날의 생산 수량 합:", range_total)
# 실행 결과
# 특정 수량 이상 생산한 날의 생산 수량 합: 830
처음에 그냥 140 나오길래 range_total = range_total + num 으로 수정했음
근데 오류 뜨길래 왜지 싶어서 보니까 함수 안에서 range_total을 선언 안해서 오류가 났던거인듯?
range_total =0 해주니까 정상적으로 고쳐짐
def find_top_seller(sales_data):
return top_product, max_sales
# 예시 데이터
sales_data = {
"Motherboard": 50,
"SSD": 2,
"Graphics Card": 30
}
print("가장 많이 판매된 제품과 수량 :", find_top_seller(sales_data))
# 실행 결과
# 가장 많이 판매된 제품과 수량 : ('Motherboard', 50)
레벨2중에 제일 어려웠다...
답(?)
↓
def find_top_seller(sales_data):
top_product = max(sales_data, key=sales_data.get)
max_sales = sales_data[top_product]
return top_product, max_sales
# 예시 데이터
sales_data = {
"Motherboard": 50,
"SSD": 2,
"Graphics Card": 30
}
print("가장 많이 판매된 제품과 수량 :", find_top_seller(sales_data))
# 실행 결과
# 가장 많이 판매된 제품과 수량 : ('Motherboard', 50)
참고)
https://hgk5722.tistory.com/460
[Python] 딕셔너리 최댓값, 최솟값 구하기 / 최댓값을 가지는 key 구하기
파이썬 딕셔너리에서 최댓값을 구하는 방법입니다. max() 함수를 사용하면 됩니다. my_dict = {'a': 10, 'b': 5, 'c': 8}max_value = max(my_dict.values())print(max_value) # 출력: 10 최댓값을 가지는 key를 구하
hgk5722.tistory.com
거의 이거 하나 한시간동안 고민했는데 딕셔너리 최대값 찾기 라고 검색하니까 금방 해결됨 ㅜㅜ
레벨 3은 어려워서 내일 도전...
'내일배움캠프(본캠프)' 카테고리의 다른 글
| [내일배움캠프] 본캠프 3/25 (0) | 2026.03.25 |
|---|---|
| [내일배움캠프] 본캠프 3/24 (0) | 2026.03.24 |
| [내일배움캠프] 본캠프 3/19 (0) | 2026.03.19 |
| [내일배움캠프] 본캠프 3/18 (0) | 2026.03.18 |
| [내일배움캠프] 본캠프 3/12 (0) | 2026.03.12 |