Lee Trader는 한국 주식 후보를 비교할 때 LightGBM 계열의 기계학습 모델을 사용합니다. LightGBM은 표 형태의 데이터에서 복잡한 관계를 찾는 데 강한 gradient boosting 알고리즘입니다. 주가 수익률, 이동평균, 거래량, 변동성, 수급, 재무처럼 성격이 다른 숫자를 한꺼번에 다룰 수 있어 주식 분석에 자주 활용됩니다.

하지만 “AI 모델을 쓴다”는 문장만으로 분석의 신뢰도가 생기지는 않습니다. 어떤 데이터를 넣었는지, 미래 정보가 과거 학습에 섞이지 않았는지, 실제 운영에서 예측이 얼마나 유지되는지 확인해야 합니다. 이 글은 LightGBM의 일반적인 원리와 Lee Trader가 모델을 사용하는 범위를 함께 설명합니다.

LightGBM은 작은 결정 규칙을 순서대로 더합니다

결정 트리는 “최근 수익률이 이 값보다 큰가”, “변동성이 이 값보다 낮은가”처럼 데이터를 여러 갈래로 나누는 모델입니다. 하나의 트리는 이해하기 쉽지만 시장의 다양한 상황을 모두 표현하기 어렵습니다. Gradient boosting은 앞선 트리가 잘 설명하지 못한 사례를 다음 트리가 보완하도록 작은 트리를 순서대로 더합니다.

LightGBM은 이 boosting 계산을 효율적으로 수행하도록 설계됐습니다. 모든 가능한 분할을 그대로 검사하는 대신 값을 구간으로 묶어 계산량을 줄이고, 개선 효과가 큰 가지를 우선 확장합니다. 이런 구조 덕분에 많은 행과 여러 특징을 비교적 빠르게 학습할 수 있습니다.

빠르다는 점은 매일 여러 종목을 다시 계산해야 하는 운영 환경에서 유용합니다. 다만 계산 속도가 예측 정확도를 보장하지는 않습니다. 트리가 너무 복잡하거나 학습 횟수가 많으면 과거 데이터에는 잘 맞지만 새로운 기간에는 약해질 수 있습니다.

주식 데이터에서 유용한 이유

주식 특징은 단순한 직선 관계로 움직이지 않습니다. 최근 수익률이 높을수록 항상 좋거나 변동성이 낮을수록 항상 좋은 것이 아닙니다. 상승률이 적당하고 거래량이 증가하며 시장 상태가 안정적일 때만 유리한 식의 조건 조합이 나타납니다. 트리 기반 모델은 이런 비선형 관계와 특징 간 상호작용을 표현할 수 있습니다.

결측값과 값의 규모가 다른 특징을 다루기 쉽다는 장점도 있습니다. 재무 비율과 가격 수익률은 단위가 다르고, 일부 종목에는 특정 재무 항목이 없을 수 있습니다. 그렇다고 전처리가 필요 없다는 뜻은 아닙니다. 결측이 발생한 이유와 극단값의 의미를 확인하지 않으면 모델이 데이터 수집 오류를 유용한 신호로 오해할 수 있습니다.

또 하나의 장점은 특징 중요도와 개별 예측 기여도를 조사할 수 있다는 점입니다. 어느 특징이 분할에 자주 사용됐는지, 특정 종목의 점수에 어떤 값이 영향을 줬는지 사후 분석할 수 있습니다. 중요도는 인과관계가 아니며, 높은 중요도가 그 지표만으로 매매할 수 있다는 뜻도 아닙니다.

Lee Trader가 입력하는 정보

현재 파이프라인은 약 204개 국내 종목에서 약 43개 특징을 계산합니다. 특징은 최근 수익률과 추세, 이동평균 위치, 거래량 변화, 변동성, 시장 대비 상대 강도, 수급, 재무와 위험 상태 등으로 나뉩니다. 실제 대상 수와 특징 수는 데이터 품질과 운영 버전에 따라 달라질 수 있습니다.

한 날짜의 특징은 그 날짜까지 알 수 있었던 정보로만 만들어야 합니다. 다음 날 가격이나 나중에 수정된 재무 값을 과거 행에 넣으면 미래를 미리 본 것과 같은 누수가 생깁니다. Lee Trader는 기준일을 보존하고 시간 순서를 유지하는 방식으로 학습 자료와 평가 자료를 나눕니다.

최근 데이터에 더 높은 비중을 주는 방식도 사용할 수 있습니다. 오래된 시장과 최근 시장의 구조가 완전히 같지 않기 때문입니다. 그러나 최근 구간만 지나치게 강조하면 짧은 유행에 맞춘 모델이 될 수 있습니다. 가중치 설정 자체도 별도 검증 대상입니다.

하나의 정답 대신 여러 기간을 봅니다

주식의 “오른다”는 표현에는 기간이 빠져 있습니다. 내일 상승과 몇 달 뒤 상승은 다른 문제입니다. Lee Trader는 서로 다른 예상 기간의 수익률을 별도 목표로 학습하고, 상위권에 들어갈 가능성을 보는 분류 결과도 함께 사용합니다.

각 모델은 같은 특징을 보더라도 다른 관계를 학습할 수 있습니다. 단기 모델은 최근 가격과 거래량 변화에 민감하고, 긴 기간 모델은 재무와 중기 추세를 더 활용할 수 있습니다. 여러 결과가 같은 방향이면 신호의 일관성이 높다고 볼 수 있지만, 서로 충돌하면 불확실성이 크다는 뜻으로 해석합니다.

화면의 종합 점수는 이 결과를 비교하기 쉽게 정리한 값입니다. 점수는 원화 수익을 보장하는 숫자가 아니며, 정확한 매수 가격과 매도 가격을 직접 말해 주지도 않습니다. 랭킹은 후보 탐색 도구이고 실제 진입은 시장 상태와 위험 정책을 통과해야 합니다.

학습과 평가는 시간 순서를 지켜야 합니다

일반 데이터에서는 행을 무작위로 섞어 학습과 검증으로 나누기도 합니다. 주식 데이터에 이 방식을 그대로 쓰면 미래 시장의 일부가 과거 학습에 들어갈 수 있습니다. 따라서 과거 구간으로 학습하고 그보다 뒤의 구간에서 평가하는 시간 분할이 필요합니다.

평가 지표도 하나로 끝나지 않습니다. 예측 오차가 작아도 상위 후보의 실제 성과가 나쁠 수 있고, 방향 정확도가 높아도 큰 손실 몇 건이 전체 손익을 훼손할 수 있습니다. Lee Trader는 예상 수익 오차, 상위권 적중, 기간별 수익, 최대 낙폭, 실제 주문과 체결 결과를 서로 다른 자료로 봅니다.

백테스트에는 거래 비용과 체결 조건을 포함해야 합니다. 종가에 신호를 만들고 같은 종가에 언제나 체결됐다고 가정하면 실제보다 좋은 결과가 나올 수 있습니다. 거래 정지, 호가 공백, 시장가 슬리피지, 주문 수량 제한도 운영 결과에 영향을 줍니다.

과적합을 줄이는 방법

LightGBM에는 트리 깊이, 잎 수, 학습률, 최소 데이터 수, 특징 표본 비율처럼 복잡도를 조절하는 설정이 있습니다. 값을 크게 만들면 학습 자료를 세밀하게 설명할 수 있지만 새로운 기간에서 성능이 떨어질 가능성도 커집니다. 적절한 설정은 과거 한 구간의 최고 점수가 아니라 여러 시간 구간의 안정성을 보고 선택해야 합니다.

불필요하게 비슷한 특징을 줄이고, 극단값을 점검하고, 학습에 사용하지 않은 기간을 남겨 두는 것도 중요합니다. 모델 버전을 기록해야 나중에 실제 주문이 어느 모델에서 나온 것인지 추적할 수 있습니다. Lee Trader의 운영 산출물은 기준일과 실행 정보를 남겨 예측과 결과를 연결하려고 합니다.

시장 국면별 성능도 따로 봐야 합니다. 강한 상승장에서 잘 작동한 모델이 하락장이나 급격한 변동성 확대 구간에서는 같은 성능을 내지 못할 수 있습니다. 전체 평균만 보면 특정 국면의 약점을 놓칠 수 있습니다.

모델이 틀리는 대표적인 경우

첫째, 학습 자료에 없던 정책 변화나 기업 이벤트가 발생할 수 있습니다. 유상증자, 거래 정지, 갑작스러운 실적 경고처럼 과거 특징만으로 설명하기 어려운 사건은 예측을 빠르게 무력화합니다.

둘째, 시장 참여자의 행동이 변합니다. 과거에 유효했던 모멘텀이나 수급 관계가 널리 알려지면 수익 기회가 줄어들 수 있습니다. 모델은 고정된 자연 법칙이 아니라 과거 참여자 행동의 흔적을 학습합니다.

셋째, 데이터 오류가 모델 오류처럼 보일 수 있습니다. 수정 주가 반영 실패, 종목 코드 변경, 재무 기준일 착오, 빈 거래량은 특징을 왜곡합니다. 그래서 운영에서는 예측 점수만큼 데이터 신선도와 파이프라인 상태가 중요합니다.

넷째, 높은 예측 점수와 좋은 거래 결과는 다를 수 있습니다. 이미 가격이 급등했다면 예상 수익이 남아 있어도 손절 폭과 변동성이 커질 수 있습니다. 계좌 비중과 주문 가능 수량도 모델이 직접 해결하지 않습니다.

LightGBM 결과를 읽는 방법

사용자는 점수의 절대값보다 같은 날짜 후보 사이의 상대 순위, 여러 기간 예측의 방향 일치, 위험 경고 유무를 함께 보는 편이 좋습니다. 어제 점수와 오늘 점수를 비교할 때는 입력 데이터 기준일과 모델 버전이 같은지도 확인해야 합니다.

종목 하나의 특징 중요도를 투자 근거 전체로 확대해서는 안 됩니다. “외국인 수급이 중요했다”는 설명은 해당 모델과 학습 구간에서 예측에 기여했다는 의미입니다. 외국인 매수가 주가 상승의 원인이라는 증명은 아닙니다.

더 넓은 분석 흐름은 한국 주식 분석 방법에서 확인할 수 있습니다. 데이터, 모델, 시장 필터, 위험 정책이 순서대로 연결돼야 점수가 실제 운영 판단으로 바뀝니다.

LightGBM은 빠르고 강력한 도구지만, 좋은 데이터와 올바른 시간 검증, 보수적인 실행 정책이 없으면 쉽게 과신할 수 있습니다. Lee Trader가 모델 점수와 별도로 관찰, 검토, 주문, 체결 상태를 기록하는 이유가 바로 여기에 있습니다.

이 글은 교육과 정보 제공을 위한 설명입니다. 특정 종목의 매수 또는 매도를 권유하지 않으며, 모델 결과는 미래 수익을 보장하지 않습니다.