[python] 데이터를 다양한 형식으로 변경할 수 있는 to_로 시작하는 메서드

💡 지피디아 핵심 브리핑

파이썬 판다스(Pandas) 환경에서 데이터프레임을 다룰 때, 정제된 데이터를 다양한 파일 포맷이나 외부 저장소로 내보내는 과정은 데이터 분석 파이프라인의 필수 단계입니다. 이름이 ‘to_’로 시작하는 다양한 메서드들을 활용하면 문자열, CSV, Excel, HTML, 딕셔너리, JSON, 마크다운, 클립보드, SQL 데이터베이스까지 복잡한 코드 없이 쉽고 직관적으로 변환 및 저장을 수행할 수 있습니다.

파이썬을 이용하다보면, 현재 불러온 데이터를 정제하여 다른 데이터 형식이나 확장자로 저장할 일이 있습니다. 이때 바로바로 사용할 수 있는 메서드들이 있습니다. to_로 시작하는 메서드들은 to_뒤에 무엇을 쓰느냐에 따라 원하는 모양으로 변경할 수 있습니다. 데이터 분석 실무에서 이러한 메서드들은 리포트 자동화, 웹 크롤링 데이터 적재, 데이터베이스 연동 등 광범위한 영역에서 활용됩니다.

to_string 메서드를 이용한 문자열 변환

데이터프레임을 화면에 깔끔하게 텍스트 형태로 시각화하거나 로그로 기록할 때 유용하게 쓰이는 기능입니다. 표 형태로 출력하는데 사용되며, index와 header 매개변수를 사용하여 인덱스와 헤더의 출력 여부를 설정할 수 있습니다.

  • to_string(): 데이터프레임을 문자열로 변환하여 출력합니다.
    • index: 기본값은 True이며, 인덱스를 출력할지 여부를 설정합니다.
    • header: 기본값은 True이며, 열 이름을 출력할지 여부를 설정합니다.
import pandas as pd

data = {'Name': ['Alice', 'Bob', 'Charlie', 'David'],
        'Age': [25, 30, 35, 40],
        'City': ['New York', 'Paris', 'London', 'Tokyo']}
df = pd.DataFrame(data)

# to_string() 메서드를 사용하여 데이터프레임을 문자열로 변환
string_output = df.to_string(index=False, header=False)  # 인덱스와 열 이름을 출력하지 않음

print("=== Output ===")
print(string_output)
=== Output ===
 Alice   25  New York
   Bob   30     Paris
Charlie  35    London
  David   40     Tokyo

to_csv 메서드를 이용한 CSV 파일 저장

데이터 분석 결과물을 가장 범용적인 형태인 CSV(Comma-Separated Values) 파일로 내보내는 표준적인 방법입니다. 구분자 변경이나 결측값 처리를 유연하게 제어할 수 있습니다.

  • to_csv(): 데이터프레임을 CSV 파일로 저장합니다.
    • path_or_buf: CSV 파일의 경로 또는 파일 객체를 지정합니다.
    • sep: 기본값은 ,이며, 필드를 구분하는 구분자를 설정합니다.
    • na_rep: 기본값은 빈 문자열('')이며, 결측값을 대체할 문자열을 설정합니다.
    • index: 기본값은 True이며, 인덱스를 포함할지 여부를 설정합니다.
import pandas as pd

data = {'Name': ['Alice', 'Bob', 'Charlie', 'David'],
        'Age': [25, 30, 35, 40],
        'City': ['New York', 'Paris', 'London', 'Tokyo']}
df = pd.DataFrame(data)

# to_csv() 메서드를 사용하여 데이터프레임을 CSV 파일로 저장
df.to_csv('output.csv', sep='|', index=False)

print("=== Output ===")
print("CSV file 'output.csv' has been saved.")
=== Output ===
CSV file 'output.csv' has been saved.

to_excel 메서드를 이용한 엑셀 파일 저장

업무 환경에서 가장 많이 쓰이는 스프레드시트 형식인 엑셀 파일로 곧바로 데이터를 기록할 수 있습니다. 시트 이름 지정 및 다중 시트 구성의 기초가 됩니다.

  • to_excel(): 데이터프레임을 Excel 파일로 저장합니다.
    • excel_writer: Excel 파일의 경로 또는 파일 객체를 지정합니다.
    • sheet_name: Excel 파일에 생성될 시트의 이름을 설정합니다.
    • na_rep: 기본값은 빈 문자열('')이며, 결측값을 대체할 문자열을 설정합니다.
    • index: 기본값은 True이며, 인덱스를 포함할지 여부를 설정합니다.
import pandas as pd

data = {'Name': ['Alice', 'Bob', 'Charlie', 'David'],
        'Age': [25, 30, 35, 40],
        'City': ['New York', 'Paris', 'London', 'Tokyo']}
df = pd.DataFrame(data)

# to_excel() 메서드를 사용하여 데이터프레임을 Excel 파일로 저장
df.to_excel('output.xlsx', sheet_name='Sheet1', index=False)

print("=== Output ===")
print("Excel file 'output.xlsx' has been saved.")
=== Output ===
Excel file 'output.xlsx' has been saved.

to_html 메서드를 이용한 웹 마크업 변환

웹 애플리케이션이나 대시보드 리포트에 데이터를 즉시 삽입할 수 있도록 유효한 HTML 테이블 태그 문자열로 바꾸어 줍니다.

  • to_html(): 데이터프레임을 HTML 형식으로 변환하여 출력합니다.
    • buf: HTML 문자열을 저장할 변수나 파일 객체를 지정합니다.
    • index: 기본값은 True이며, 인덱스를 출력할지 여부를 설정합니다.
    • border: 기본값은 1이며, 테이블의 테두리 두께를 설정합니다.
import pandas as pd

data = {'Name': ['Alice', 'Bob', 'Charlie', 'David'],
        'Age': [25, 30, 35, 40],
        'City': ['New York', 'Paris', 'London', 'Tokyo']}
df = pd.DataFrame(data)

# to_html() 메서드를 사용하여 데이터프레임을 HTML 형식으로 변환
html_output = df.to_html(index=False)

print("=== Output ===")
print(html_output)
=== Output ===
<table border="1" class="dataframe">
  <thead>
    <tr style="text-align: right;">
      <th>Name</th>
      <th>Age</th>
      <th>City</th>
    </tr>
  </thead>
  <tbody>
    <tr>
      <td>Alice</td>
      <td>25</td>
      <td>New York</td>
    </tr>
    <tr>
      <td>Bob</td>
      <td>30</td>
      <td>Paris</td>
    </tr>
    <tr>
      <td>Charlie</td>
      <td>35</td>
      <td>London</td>
    </tr>
    <tr>
      <td>David</td>
      <td>40</td>
      <td>Tokyo</td>
    </tr>
  </tbody>
</table>

to_dict 및 to_json을 활용한 자료구조 변환

파이썬 내부의 기본 자료구조인 딕셔너리 형태나 API 통신에 표준으로 사용되는 JSON 포맷으로 데이터를 전환하는 기법입니다.

  • to_dict(): 데이터프레임을 딕셔너리로 변환합니다.
    • orient: 기본값은 'dict'이며, 딕셔너리 형식으로 변환할 방식을 설정합니다. 'dict', 'list', 'series', 'split', 'records' 중 하나를 선택할 수 있습니다.
import pandas as pd

data = {'Name': ['Alice', 'Bob', 'Charlie', 'David'],
        'Age': [25, 30, 35, 40],
        'City': ['New York', 'Paris', 'London', 'Tokyo']}
df = pd.DataFrame(data)

# to_dict() 메서드를 사용하여 데이터프레임을 딕셔너리로 변환
dict_output = df.to_dict(orient='records')  # records 형식으로 변환

print("=== Output ===")
print(dict_output)
=== Output ===
[{'Name': 'Alice', 'Age': 25, 'City': 'New York'}, {'Name': 'Bob', 'Age': 30, 'City': 'Paris'}, {'Name': 'Charlie', 'Age': 35, 'City': 'London'}, {'Name': 'David', 'Age': 40, 'City': 'Tokyo'}]
  • to_json(): 데이터프레임을 JSON 형식으로 변환합니다.
    • path_or_buf: JSON 파일의 경로 또는 파일 객체를 지정합니다.
    • orient: 기본값은 'columns'이며, JSON 형식으로 변환할 방식을 설정합니다. 'columns', 'index', 'records', 'split' 중 하나를 선택할 수 있습니다.
import json

data = {
    'name': 'John',
    'age': 30,
    'city': 'New York'
}

json_data = json.dumps(data)

print(json_data)
{"name": "John", "age": 30, "city": "New York"}

to_markdown, to_clipboard, to_sql의 응용

문서 작성, 임시 복사, 데이터베이스 적재 등 특수한 목적을 수행하는 메서드들의 구조입니다.

  • to_markdown(): 데이터프레임을 Markdown 형식으로 변환하여 출력합니다.
    • index: 기본값은 True이며, 인덱스를 출력할지 여부를 설정합니다.
    • tablefmt: Markdown 표 형식을 설정합니다. 'pipe', 'simple', 'github', 'grid' 등이 있습니다.
def to_markdown(data):
    markdown = ""
    for key, value in data.items():
        markdown += f"| {key} | {value} |\n"
    
    return markdown

data = {
    'name': 'John',
    'age': 30,
    'city': 'New York'
}

markdown_data = to_markdown(data)

print(markdown_data)
| name | John |
| age | 30 |
| city | New York |
  • to_clipboard(): 데이터프레임을 클립보드에 복사합니다.
    • excel: 기본값은 True이며, 클립보드에 데이터를 복사할 때 Excel 형식으로 복사할지 여부를 설정합니다.
import pyperclip

data = {
    'name': 'John',
    'age': 30,
    'city': 'New York'
}

pyperclip.copy(str(data))
(클립보드에 복사됨)
  • to_sql(): 데이터프레임을 SQL 데이터베이스에 저장합니다.
    • name: 저장할 테이블의 이름을 설정합니다.
    • con: 데이터베이스 연결 객체를 지정합니다.
    • if_exists: 기본값은 'fail'이며, 동일한 이름의 테이블이 이미 존재할 경우의 동작 방식을 설정합니다. 'fail', 'replace', 'append' 중 하나를 선택할 수 있습니다.
    • index: 기본값은 True이며, 인덱스를 포함할지 여부를 설정합니다.
import sqlite3

def to_sql(data, table_name):
    conn = sqlite3.connect('data.db')
    cursor = conn.cursor()
    
    create_table_query = f"CREATE TABLE IF NOT EXISTS {table_name} (id INTEGER PRIMARY KEY, name TEXT, age INTEGER, city TEXT);"
    cursor.execute(create_table_query)
    
    insert_data_query = f"INSERT INTO {table_name} (name, age, city) VALUES (?, ?, ?);"
    cursor.execute(insert_data_query, (data['name'], data['age'], data['city']))
    
    conn.commit()
    conn.close()

data = {
    'name': 'John',
    'age': 30,
    'city': 'New York'
}

to_sql(data, 'person')
(SQLite 데이터베이스에 데이터가 저장됨)

데이터 형식 변환 메서드 비교 가이드

메서드 명칭 주요 목적 및 대상 핵심 매개변수
to_string() 콘솔 출력 또는 문자열 형태 변환 index, header
to_csv() CSV 파일 저장 및 외부 연동 sep, na_rep, index
to_excel() 엑셀 스프레드시트 기록 sheet_name, na_rep
to_html() 웹 브라우저 마크업 출력 buf, border
to_dict() 파이썬 딕셔너리 구조 전환 orient
to_json() JSON 문서 저장 및 API 포맷화 orient, path_or_buf
to_sql() 관계형 데이터베이스 테이블 적재 name, con, if_exists

자주 묻는 질문 (FAQ)

Q1. to_csv() 사용 시 한글 데이터가 깨지는 현상은 어떻게 해결하나요?

운영체제나 기본 인코딩 설정에 따라 한글이 깨질 수 있습니다. 이 경우 encoding='utf-8-sig' 또는 encoding='cp949' 매개변수를 추가하여 파일을 저장하면 정상적으로 텍스트를 확인할 수 있습니다.

Q2. to_sql() 수행 시 테이블이 이미 존재하면 어떻게 처리되나요?

기본값인 if_exists='fail' 설정 상태에서는 에러가 발생합니다. 테이블을 새로 덮어쓰고 싶다면 'replace'를 지정하고, 기존 데이터 뒤에 이어서 기록하려면 'append' 옵션을 사용하면 됩니다.

위로 스크롤