/users
/posts
/slides
/apps
/books
mysetting
/users
/posts
/slides
/apps
/books
2:47 5/30
kangmyounghun.blogspot.kr
2:47
kangmyounghun.blogspot.kr
케세라세라
https://kangmyounghun.blogspot.kr/
Easy to analyze if you can cleaning data
저작도구: Blogger
최종 피드 수집: 2026-09-17 20:17
전체 (290)
2d
Splunk의 xml 처리 - 2nd
makeresults를 이용한 xml 테스트 환경. csv 포맷이라 ,를 기준으로 데이터가 잘린다.
eval 명령으로 변경. 그런데 데이터 추가 실패. xml에 포함된 "와 필드 데이터 구분자인 "가 충돌하기 때문.
xml에 포함
tech
+ 더보기
0
0
2
읽기모드
4d
엘라스틱 Runtime field - 15th
로그스태시는 문자열 필드를 text(검색용)와 keyword(집계용) 타입으로 나누는데, 이때 집계용 필드 이름에 keyword(fieldname.keyword)를 붙여서 text 타입과 구분한다. beat도 타입별 역할은 같은데
tech
+ 더보기
0
0
0
읽기모드
20d
ESQL - 4th
오늘 새롭게 발생한 프로세스 검색.
MySQL 5.7 버전 이하는 이렇게.
또는 Logparser처럼.
스플렁크는 이렇게.
이제 엘라스틱도 된다.
다른 분야는 모르겠지만 IT 환경에서 모든 데이터 분석의 시작은 결국 SQL. 근본
tech
+ 더보기
0
0
3
읽기모드
22d
정규표현식: 문자클래스 범위
버전 정보를 제외한 문자열만 추출하고 싶다. 특수문자 / 제외.
제외할 문자 범위에 - 추가.
그런데 _를 추가하니 검사 결과가 이상하다.
이유는 -가 /와 _ 사이의 문자 범위를 지정하는 특수문자로 동작하기 때문.
맨 끝(또는
tech
+ 더보기
0
0
1
읽기모드
1M
데이터 시인성 - 10th
데이터 발생 확률을 측정해주는 anomalousvalue 실행 결과. 값이 0에 가까울수록 발생 확률이 낮다는 의미이기 때문에 그만큼 이상징후일 가능성이 높다.
문제는 값이 0에 가까울수록 눈으로 확인하기 어려운 차트가 그려진다는
tech
+ 더보기
0
0
1
읽기모드
1M
Logstash 권한 - 3rd
간만에 로그스태시. root 실행을 아예 막아놨네? path.settings 옵션 없으면 logstasy.yml도 찾지 못하고(..)
logstash 계정 실행은 문제 없다.
그런데 root 계정 실행을 먼저 해버리면 이후 log
tech
+ 더보기
0
0
5
읽기모드
1M
엘라스틱 Runtime field - 14th
특정 필드의 해시값(fingerprint)을 구한 후, 숫자(hexnum)로 바꾸는 beat 설정. 기본 해시 알고리즘은 256bit(64자리) 해시값을 만드는 sha256.
processors:
- include_fields
tech
+ 더보기
0
0
7
읽기모드
1M
LogParser의 문자열 처리 - 2nd
로그온 사용자, 유형별 발생 현황.
사용자와 로그온 유형 정보를 합치고 싶다.
좀 더 보기 좋게 구분.
이런 경험들이 쌓이고 모이면 엘라스틱도,
스플렁크도 쉬워진다.
빅데이터/인공지능이 유행하기 전부터 로그를 한 줄, 한 줄 읽어
tech
+ 더보기
0
0
1
읽기모드
1M
ESQL - 3rd
웹로그 발생 추이.
집계 분할 기준을 추가하니 차트가 이상해짐.
계산 간격을 좁히면 차트가 정상적으로 그려진다.
원인은 ESQL이 계산할 수 있는 기본 데이터 범위가 1,000개 이기 때문. 범위 확대.
최소 범위 제한에 걸려도
tech
+ 더보기
0
0
2
읽기모드
1M
데이터 노가다 실수담 - 19th
웹로그 발생 추이.
응답코드별 분류. 두 번째 집계 분할 기준부터는 Y축을 사용한다.
그런데 grok 필터로 만든 응답코드가 아닌, 엘라스틱이 만들어준 응답코드 필드를 두 번째 집계 분할 기준으로 선택하면 분류가 되지 않는다.
파
tech
+ 더보기
0
0
1
읽기모드
2M
데이터 분석이 쉬워지는 비법 - 5th
서로 다른 변수 20만 개가 발생한 웹로그.
그런데 이런 유형의 변수를 서로 다르다고 인정해줄 필요가 있을까?
나는 변수값의 변화가 아닌, 변수라는 큰 틀의 변화가 보고 싶다. 숫자 변수값 삭제.
숫자 변수값을 삭제하지 않은 필드
tech
thinking
+ 더보기
0
0
2
읽기모드
2M
엘라스틱 with LLM
엘라스틱의 LLM 연동 설정.
맥락이 유지되는 질답 작업을 하려면 chat_completion 옵션이 필요하다는데, 제미나이(Google AI Studio) 설정 화면에서는 보이지 않는다.
Ollama를 써보고 싶은데, 얘는 아
tech
+ 더보기
0
0
2
읽기모드
2M
Splunk with LLM - 2nd
로컬 LLM 플랫폼 Ollama 설치.
모델 설치.
1
2
3
4
5
6
7
8
9
10
11
12
13
PS C:\WINDOWS\system32> ollama pull qwen2.5-coder:7b
pulling manifest
tech
+ 더보기
0
0
0
읽기모드
2M
AntigravityCLI
geminiCLI 실행이 안 된다. 서비스를 중단한 모양. Antigravity는 또 뭐여(..) 윈도우에서 geminiCLI를 사용하려면 Node.js 사전 설치가 필요했는데 얘는 필요 없는 듯. 설치 스크립트 링크 카피.
PS
tech
+ 더보기
0
0
0
읽기모드
3M
데이터 노가다 실수담 - 18th
+and+ 패턴을 검사하는 정규표현식.
그런데 필드 추출 결과가 이상하다. 실제 검사 결과에 포함되지 않는 패턴이 추가됨.
원본 데이터를 보면 두 패턴은 연결되어 있지도 않다. 뭐지?
원본과 정규표현식 검사 과정을 비교해보니 원본
tech
+ 더보기
0
0
3
읽기모드
3M
esql timezone - 2nd
esql이 나온지도 2년. 좀 좋아졌나 싶어 오랜만에 써봤는데, 일단 GMT 기준으로 계산되던 시간 문제는 해결된 듯.
그 외엔 변화가 없는 것 같다. 첫 번째 진입장벽은 필요한 테이블 구조를 만들 때 관련 구문을 매번 입력하는
tech
+ 더보기
0
0
0
읽기모드
3M
노가다는 AI에게
요즘 자주 보이는 마케팅.
발전, 성취감 대신 지루함만 느끼기 십상이라 사람들은 대부분 단순 반복 작업을 싫어한다. AI가 해주면 땡큐지. 단순하고 반복적인 작업은 AI에게 맡기고 사람은 창의성을 발휘하자는, 너무나 이상적인 카
thinking
+ 더보기
0
0
2
읽기모드
3M
TA-linux_secure - 3rd
TA-linux_secure 앱(버전 이슈인지 현재 검색은 안 됨)을 설치하면 스플렁크에 기본 내장된 linux_secure 소스타입 기능을 보강할 수 있다. 그런데 해당 앱이 만들어준 테이블 구조가 마음에 들지 않는다면?
해당
tech
+ 더보기
0
0
1
읽기모드
3M
연애와 데이터 분석의 공통점
궁금하면 어떻게든 분석한다
궁금하면 데이터 노가다가 재밌어짐
관찰하는 과정에서 궁금증이 생기고, 궁금증이 생겼을 때 분석이 시작된다
비법 찾을 시간에 데이터 한 번 더 보자
차이점
ㅜㅜ
내가 좋아한 만큼 나를 좋아해준다
관련 글
thinking
+ 더보기
0
0
14
읽기모드
3M
데이터 노가다 실수담 - 17th
[로 끝나는 Z를 검사하는 PCRE 전방탐색. 사용된 ()는 둘이지만, 전방탐색은 캡쳐그룹으로 동작하지 않는다.
치환 과정에서 두 번째 캡쳐그룹이 동작하지 않는 이유.
후방탐색도 마찬가지.
VIM 치환 과정에서는 두 번째 캡쳐 그
tech
+ 더보기
0
0
4
읽기모드
About
Badge
Contact
Activity
Terms of service
Privacy Policy