위로금 지급여부 대기 강남 반포바버샵 웸블리 바버샵 고속터미널점 투블럭 상고, 다운펌, 가일스타일새 창 열림
작성자 정보
- 차분한요리사35 작성
- 작성일
컨텐츠 정보
- 5 조회
- 목록
본문
| 사이트 이름 | |
|---|---|
| 사이트 주소 | |
| 피해 금액 | 원 |
| 피해 날짜 |
데이터라벨링 부업, 실제로 어떤 일을 하는 걸까?작업 종류 19가지 총정리 (2026.06 기준)Outlier · Data Annotation · Oneforma · Babel Audio · Turing · Telus 실제 후기안녕하세요. 작년부터 다양한 데이터라벨링 플랫폼에서 부업을 해오고 있는 N잡러입니다.처음 시작하실 때 가장 헷갈리는 부분이 데이터 어노테이션 부업이 도대체 어떤 일인지"입니다. 플랫폼마다 부르는 이름이 Search Quality Evaluation, AI Training Data, Content Moderation"등 제각각이라 더 헷갈리죠.하지만 프로젝트 이름은 달라도, 결국 작업 유형은 비슷비슷합니다. 가장 많이 만나게 되는 19가지 작업 카테고리를 실제 사례와 함께 정리해보았습니다.이런 분들께 추천드립니다AI 데이터 라벨링 부업"검색하다 막막해진 입문자Outlier·Data Annotation·Oneforma 등 가입은 했는데 어떤 작업인지 헷갈리시는 분플랫폼별 작업 종류 차이가 알고 싶으신 분어떤 카테고리부터 시도하면 좋을지 고민이신 분 1. 기본 12가지 카테고리 2024년 이전부터 데이터라벨링의 핵심이었던 12가지 카테고리입니다. 지금도 여전히 진행되고 있고, 입문자라면 먼저 이쪽부터 익히시는 것이 좋습니다.1. Needs Met (요구 충족도) — 검색 품질 평가의 기초검색엔진 최적화, 사용자 만족도 측정, 웹페이지 품질평가를 핵심으로 하는 작업입니다. 구글, 빙, 야후 등 검색엔진의 결과가 사용자 질문에 얼마나 적절한지 평가합니다. 데이터라벨링 부업에서 가장 기본적인 형태 중 하나입니다. 실제 작업 예시사용자가 iPhone 15 Pro 가격을 검색했을 때, 다음과 같이 5단계로 평가합니다.Fully Meets (완전 충족) — 애플 공식 홈페이지나 주요 온라인 쇼핑몰에서 iPhone 15 Pro의 정확한 가격, 스펙, 구매 링크를 모두 제공하는 페이지Highly Meets (높은 충족) — 여러 쇼핑몰의 가격 비교와 함께 할인 정보, 사용자 리뷰까지 제공하는 페이지Moderately Meets (보통 충족) — iPhone 15 Pro 가격은 나와있지만 구형 모델 정보가 섞여있거나 일부 정보가 누락된 페이지Slightly Meets (약간 충족) — iPhone 관련 정보는 있지만 Pro 모델 구분 없이 일반적인 정보만 제공하는 페이지Fails to Meet (충족 실패) — iPhone과 전혀 관련 없는 안드로이드 폰 정보나 완전히 다른 주제의 페이지 핵심 포인트이 작업에서 중요한 것은 사용자의 검색 의도를 정확히 파악하는 것입니다. 예를 들어 강남 카페라고 검색한 사람이 지금 당장 갈 수 있는 카페를 찾는 건지, 아니면 강남 지역 카페 트렌드에 대한 정보를 원하는 건지 구분해야 합니다. 주로 어디서 만나나Telus(텔루스), RWS, Welo의 미디어 서치 작업이 대표적입니다. 2. YMYL (Your Money or Your Life) — 민감 정보 신뢰성 검증의료정보 검증, 금융정보 평가, 법률정보 신뢰도를 다루는 YMYL 작업은 사람의 생명, 건강, 재산에 직접적인 영향을 미치는 정보의 신뢰성을 평가합니다. 가장 까다롭지만 중요한 작업 중 하나입니다. 실제 작업 예시 — 의료 정보코로나19 백신 부작용에 대한 검색 결과를 평가할 때 다음과 같이 분류합니다.High Trust (높은 신뢰도)질병관리청, WHO, FDA 등 공식 의료기관의 발표자료대형 병원의 공식 홈페이지에서 의료진이 작성한 글의학 논문이나 임상시험 결과를 인용한 기사Medium Trust (중간 신뢰도)의료 전문가가 인터뷰한 언론 기사 (출처가 명확한 경우)의료진이 운영하는 개인 블로그 (자격증명 확인된 경우)Low Trust (낮은 신뢰도)개인 블로그나 카페에서 일반인이 작성한 후기출처가 불분명하거나 의학적 근거가 없는 주장특정 제품 판매를 목적으로 하는 의료 정보 실제 작업 예시 — 금융 정보주식 투자 방법을 검색했을 때, 금융감독원이나 한국거래소의 공식 가이드는 High Trust로 평가합니다. 반면 개인의 투자 성공담이나 무료 주식 정보"광고 페이지는 Low Trust로 평가합니다.3. Page Quality (페이지 품질) — 웹사이트 종합 평가웹사이트 품질평가, 콘텐츠 전문성 분석, 사용자 경험 측정이 핵심인 작업입니다. 웹페이지의 전반적인 품질을 종합적으로 판단합니다. 실제 작업 예시 — 요리 레시피 사이트High Quality (고품질)전문 셰프나 요리연구가가 강남웸블리 운영하는 사이트단계별 사진과 상세한 설명이 포함된 레시피영양 정보, 조리 시간, 난이도 등 부가 정보 제공사용자 리뷰와 평점 시스템 운영광고가 적당하고 페이지 로딩이 빠름Medium Quality (중간 품질)요리에 관심 있는 일반인이 운영하는 블로그기본적인 레시피는 제공하지만 전문성이 부족일부 단계의 설명이 불분명하거나 사진이 부족Low Quality (저품질)다른 사이트에서 복사한 것으로 보이는 콘텐츠오타가 많고 사진의 화질이 떨어짐과도한 팝업 광고로 사용자 경험을 방해재료나 조리법에 명백한 오류가 있음 핵심 — E-A-T 기준평가할 때는 E-A-T (Expertise 전문성, Authoritativeness 권위성, Trustworthiness 신뢰성) 기준을 적용합니다. 이 세 가지가 모두 갖춰진 페이지일수록 높은 점수를 받습니다. 주로 어디서 만나나Welodata의 Page Quality 프로젝트가 대표적입니다. 가이드라인이 방대해서 테스트 통과가 쉽지 않은 편이지만, 통과하면 꾸준한 작업을 받을 수 있습니다.4. Sentiment Analysis (감성 분석) — 텍스트 감정 분류고객리뷰 분석, 소셜미디어 감정분석, 브랜드 평판관리를 위한 작업으로, 텍스트에 담긴 감정을 정확히 파악하여 분류합니다. 실제 작업 예시 — 쇼핑몰 리뷰Strong Positive (강한 긍정) — 정말 최고예요! 가격 대비 품질이 너무 좋아서 가족들에게도 추천했어요. 다음에 또 구매할 예정입니다!Positive (긍정) — 만족합니다. 생각했던 것보다 좋네요. 배송도 빨랐어요.Neutral (중립) — 평범해요. 가격 생각하면 그럭저럭 쓸 만합니다.Negative (부정) — 기대했는데 실망이에요. 사진과 실물이 달라서 아쉽습니다.Strong Negative (강한 부정) — 완전 실망! 돈 아까워요. 고객센터 응대도 불친절해서 다시는 안 사겠어요. 복합 감정 분석배송은 정말 빨랐는데, 제품 포장이 너무 허술해서 상품이 찌그러져서 도착했어요."→ 배송(긍정) + 포장/상품상태(부정) =Mixed 또는 Overall Negative감정 분석에서 중요한 것은 문맥을 이해하는 것입니다. 진짜 대박이네요라는 표현도 앞뒤 문맥에 따라 긍정적 감탄일 수도, 부정적 비꼼일 수도 있습니다. 참고: 2025년 이후 AI가 이 작업을 너무 잘하게 돼서 단순 분류는 단가가 많이 떨어졌습니다. 이제는 전문 분야 감성 분석이나 미묘한 뉘앙스 분석"같은 고난이도 작업 위주로 진화 중입니다.5. Named Entity Recognition (NER) — 개체명 인식자연어처리, 정보추출 기술, 텍스트마이닝의 핵심 작업으로, 텍스트에서 특정 개체를 찾아 올바른 카테고리로 분류합니다. 실제 작업 예시 — 스포츠 기사손흥민 토트넘 주장이 어제 저녁 웸블리 스타디움에서 열린 경기에서 2골을 기록했다.손흥민 → PERSON (인물)토트넘 → ORGANIZATION (스포츠팀)주장 → TITLE (직책)어제 저녁 → TIME (시간)웸블리 스타디움 → LOCATION (장소)경기 → EVENT (행사)2골 → QUANTITY (수량) 복잡한 예시삼성전자는 2024년 3월 15일 수원시 영통구에 위치한 디지털시티에서 갤럭시 S24 Ultra 신제품 발표회를 개최했다.삼성전자 → ORGANIZATION (기업)2024년 3월 15일 → DATE (날짜)수원시 영통구 → LOCATION (지역)디지털시티 → LOCATION (건물/시설)갤럭시 S24 Ultra → PRODUCT (제품명)신제품 발표회 → EVENT (행사)동일한 단어라도 문맥에 따라 다르게 분류될 수 있습니다. 현대가 현대자동차를 지칭하면 ORGANIZATION이지만, 현대 사회에서는 TIME/ERA로 분류됩니다.6. Object Detection (객체 검출) — 이미지 내 객체 식별이미지 인식기술, 자율주행 데이터, 컴퓨터비전 학습을 위해 이미지나 동영상에서 특정 객체를 찾아 정확한 위치를 표시하는 작업입니다. 실제 작업 예시 — 도시 거리 사진차량 종류별 구분승용차 (파란색 박스)SUV (초록색 박스)트럭 (빨간색 박스)오토바이 (노란색 박스)자전거 (보라색 박스)보행자 관련성인 (하늘색 박스)어린이 (분홍색 박스)유모차 (갈색 박스)교통 시설물신호등, 도로 표지판, 횡단보도, 버스 정류장 의료 영상 분석흉부 X-ray 이미지에서 정상 폐 조직(초록), 염증 부위(빨강), 심장(파랑), 갈비뼈(흰색)를 각각 구분합니다.정확도가 매우 중요한 작업이므로, 객체의 경계를 정밀하게 강남웸블리 설정해야 합니다. 특히 자율주행차 데이터의 경우 잘못된 라벨링이 사고로 이어질 수 있어 더 신중해야 합니다.7. Segmentation (분할) — 픽셀 단위 영역 분류의료영상 분석, 위성이미지 처리, 로봇비전 데이터를 위한 작업으로, Object Detection보다 더 정밀하게 이미지를 픽셀 단위로 분할합니다. 경계 상자가 아닌 실제 객체의 모양을 따라 정확히 칠해야 하는 섬세한 작업입니다. 의료 MRI 뇌 스캔 이미지 분할회백질 (밝은 회색으로 마스킹)백질 (어두운 회색으로 마스킹)뇌척수액 (파란색으로 마스킹)뇌종양 의심 부위 (빨간색으로 마스킹)두개골 (흰색으로 마스킹) 농업 드론 이미지 분할건강한 벼 (짙은 초록색)병든 작물 (갈색)잡초 (연한 초록색)토양 (갈색)관개수로 (파란색), 농기계 (회색), 건물 (흰색) 자율주행 도로 이미지 분할차선(노란색), 아스팔트 도로(어두운 회색), 인도(밝은 회색), 건물(갈색), 나무/식생(초록색), 하늘(하늘색), 차량(빨간색), 보행자(주황색)를 픽셀 단위로 구분합니다.8. Intent Classification (의도 분류) — 사용자 의도 파악챗봇 개발, 고객서비스 자동화, 음성비서 학습을 위해 사용자의 텍스트에서 실제 의도를 파악하여 적절한 카테고리로 분류합니다. 실제 작업 예시 — 쇼핑몰 고객 문의주문 관련 문의어제 주문한 상품이 언제 도착하나요?"→ DELIVERY_INQUIRY주문을 취소하고 싶어요"→ ORDER_CANCEL주문 내역을 확인하고 싶습니다"→ ORDER_CHECK상품 관련 문의이 상품 재고가 있나요?"→ STOCK_INQUIRY다른 색상은 없나요?"→ PRODUCT_OPTION사이즈가 안 맞아서 교환하고 싶어요"→ EXCHANGE_REQUEST결제 관련 문의할인 쿠폰을 어떻게 사용하나요?"→ COUPON_USAGE카드 결제가 안 돼요"→ PAYMENT_ERROR환불은 언제 되나요?"→ REFUND_INQUIRY 복합 의도 분류주문한 상품이 불량인 것 같은데 환불받을 수 있나요?"→ PRODUCT_DEFECT + REFUND_REQUEST (다중 라벨)사용자가 직접적으로 표현하지 않은 숨겨진 의도도 파악해야 합니다. 요즘 할인하는 상품 있나요?는 단순 정보 문의가 아닌 구매 의도가 있는 것으로 분류해야 합니다.9. Transcription (음성 전사) — 오디오를 텍스트로 변환음성인식 기술, 자동자막 생성, 회의록 작성을 위해 다양한 음성 데이터를 정확한 텍스트로 변환하는 작업입니다. 전사 방식의 변화요즘 AI 음성인식 학습용 데이터에서는 자연스러운 대화의 특성을 보존하기 위해 추임새도 그대로 살리는 추세입니다.• 클린 전사 (Clean Transcription) — 전통적 방식원음성: 어... 그니까 이번 분기 매출이 어... 작년 동기 대비해서 한 15% 정도 증가한 걸로 보이는데, 음... 다음 달까지는 더 늘어날 것 같아요.전사 결과: 이번 분기 매출이 작년 동기 대비해서 한 15% 정도 증가한 것으로 보이는데, 다음 달까지는 더 늘어날 것 같습니다.• 버바팀 전사 (Verbatim Transcription) — 최신 방식원음성과 동일하게 추임새까지 모두 전사합니다: 어... 그니까 이번 분기 매출이 어... 작년 동기 대비해서 한 15% 정도 증가한 걸로 보이는데, 음... 다음 달까지는 더 늘어날 것 같아요. 프로젝트별 요구사항AI 음성인식 학습: 모든 소리 그대로 전사 (추임새, 기침소리까지)비즈니스 회의록: 클린 전사로 가독성 중시법정 기록: 발언 그대로 정확히 전사팟캐스트 자막: 청취자 이해도에 따라 선택 특수 표기법망설임: 음... 잠깐만요"(의미 있는 침묵)동시발화: [A+B 동시발화]웃음소리: [웃음] 또는 하하하기침: [기침] 또는 콜록콜록들리지 않음: [inaudible]소리는 들리지만 무슨 말인지 알아들을 수 없는 경우: [unintelligible]여러 사람이 동시에 말해서 들리지 않는 경우: [crosstalk] 주로 어디서 만나나Babel Audio(바벨오디오)가 한국어 음성 전사의 대표 플랫폼입니다. Welo의 Lyric Translation Reviewer도 음성·가사 관련 전사 작업으로 자주 등장합니다. 영어 위주로는 TranscribeMe, Rev가 메이저입니다.10. Speaker Diarization (화자 분리) — 다중 화자 구분회의록 자동화, 팟캐스트 편집, 법정 기록 관리를 위해 여러 명이 대화하는 음성에서 강남웸블리 각 화자를 정확히 구분하는 고급 작업입니다. 실제 작업 예시 — 4명 회의00:00:15 — 화자1 (김팀장): 오늘 회의 시작하겠습니다. 먼저 지난주 진행 상황부터 확인해보죠.00:00:25 — 화자2 (이과장): 네, 저희 개발팀은 예정대로 진행되고 있습니다. 90% 정도 완료됐어요.00:00:35 — 화자3 (박대리): 마케팅 쪽은 조금 지연되고 있습니다. 디자인 검토가 늦어져서요.00:00:45 — 화자1 (김팀장): 언제까지 가능할까요?00:00:50 — 화자3 (박대리): 이번 주 금요일까지는 완료할 수 있을 것 같습니다. 화자 구분 기준음성 높낮이: 남성/여성, 개인별 음성 특성말하는 속도: 빠름/보통/느림억양 패턴: 지역별 특성, 개인별 말투호흡 패턴: 문장 끝의 숨쉬기 패턴배경소음: 화자별 마이크 거리나 환경 차이 주로 어디서 만나나Appen의 푸린"같은 프로젝트에서 speaker 1, 2, 3, 4..."형식으로 세그먼트를 나누는 작업으로 진행됩니다. 단순 전사보다 한 단계 위 작업입니다.11. Ranking (순위 매기기) — 검색 결과 우선순위 결정검색엔진 최적화, 추천시스템 개발, 정보 우선순위 결정을 위해 동일한 질문에 대한 여러 답변을 품질과 관련성에 따라 순위를 매기는 작업입니다. 실제 작업 예시 — 감기 빨리 낫는 방법"검색1순위 — 충분한 휴식과 수분 섭취가 가장 중요합니다. 따뜻한 물이나 차를 자주 마시고, 비타민 C가 풍부한 과일을 섭취하세요. 증상이 심하거나 3일 이상 지속되면 병원에 방문하시기 바랍니다."(의학적 정확 + 실용 + 전문의 상담 언급)2순위 — 휴식을 취하고 물을 많이 마시세요. 꿀차나 생강차도 도움이 됩니다."(기본 정보 OK, 구체성 부족)3순위 — OO 감기약을 드세요. 하루만에 낫습니다!"(특정 제품 광고성, 과장)4순위 — 마늘을 생으로 10개씩 먹으면 됩니다."(비현실적 민간요법)순위를 매길 때는 정확성, 완성도, 최신성, 신뢰성을 종합적으로 고려해야 합니다. 주로 어디서 만나나Welo의 Lyra 같은 프로젝트에서 listening / speaking / preference ranking / factuality"가 한 패키지로 묶여서 자주 진행됩니다. 단독 Ranking 작업보다는 다른 평가 작업과 함께 묶여서 나옵니다.12. Quality Rating (품질 평가) — AI 생성 콘텐츠 평가AI 콘텐츠 검증, 자동생성 텍스트 평가, 머신러닝 모델 개선을 위해 AI가 생성한 다양한 콘텐츠의 품질을 객관적으로 평가하는 종합적인 작업입니다. 실제 작업 예시 — AI가 작성한 부산 여행 가이드"평가평가 기준별 점수 (1-5점 척도):1. 정확성 (Accuracy): 4점 — 관광지 위치·운영시간 정확, 일부 식당 가격 정보가 오래됨2. 완성도 (Completeness): 5점 — 교통·숙박·관광·음식 모든 영역 포함, 3박 4일 일정 구체적3. 가독성 (Readability): 3점 — 구성은 논리적, 일부 문장이 어색하고 반복적4. 창의성 (Creativity): 2점 — 일반적인 관광코스만, 독특한 장소 부족5. 실용성 (Usefulness): 4점 — 교통편 정보 상세, 실제 여행에 도움되는 팁 포함종합 점수: 3.6점 2. 2025-2026 신규 카테고리작년까지만 해도 위 12가지가 데이터라벨링의 거의 전부였는데, 2025년부터 LLM 시대가 본격화되면서 새로운 카테고리들이 메인으로 떠올랐습니다.13. Response Comparison / RLHF — 두 AI 답변 비교 ⭐현재 가장 수요가 많은 작업이자, Outlier 온보딩 시 가장 자주 만나게 되는 유형입니다. ChatGPT, Claude, Gemini 같은 LLM(대형 언어 모델) 학습의 핵심이라 단가가 가장 높습니다. 실제 작업 예시같은 질문 파이썬으로 웹크롤링 하는 방법을 알려줘"에 대해 AI A와 AI B가 각각 답변합니다. 작업자는 두 답변을 다음 기준으로 비교 평가합니다.정확성 — 코드가 실제로 작동하는가? 라이브러리는 최신인가?완성도 — 필요한 단계(설치, import, 에러 처리)가 다 포함됐는가?가독성 — 코드 설명이 명확한가? 주석은 적절한가?창의성/유용성 — 추가 학습 자료 추천, 주의사항 등 부가가치안전성 — 웹사이트 이용약관 무시하는 내용은 없는가?최종 평가: A가 약간 좋음 / 둘이 비슷함 / B가 훨씬 좋음"같은 5단계 스케일로 평가하고, 그 이유를 Justification으로 작성합니다. 강남웸블리 주로 어디서 만나나Outlier의 Aether, Lighthouse(이발소), Cypher, Astrochat 등 거의 모든 평가 프로젝트가 이 유형입니다. xAI(Perle), Welodata에서도 활발합니다. 시급일반 분류 작업의 1.5~2배 수준입니다. 단, Justification을 한 땀 한 땀 작성해야 해서 시간이 꽤 들어갑니다.14. Multimodal Evaluation — 이미지+텍스트 멀티모달 평가이미지를 보고 AI가 답변한 내용이 정확한지 평가하는 작업입니다. 단순 텍스트 평가보다 한 단계 위로, 2026년 들어 빠르게 늘고 있는 분야입니다. 실제 작업 예시강아지 사진 + 이 강아지의 품종은?"→ AI 답변이 정확한지 평가음식 사진 + 이 요리의 칼로리는?"→ 추정치가 합리적인지차트/그래프 + 이 차트에서 2024년 매출은?"→ 시각 자료 읽기 평가의료 영상(X-ray, CT) + AI 진단 의견 → 정확성 평가 (전문가용)두 AI(A vs B)의 이미지 분석 답변 비교 평가 주로 어디서 만나나Outlier, Turing(튜링), Alignerr가 주력입니다. Outlier의 text-image-to-text-h2h"같은 프로젝트가 대표적입니다.15. Code Evaluation — AI 코드 평가 튜링(Turing) 부업의 메인 트랙이자 시급이 가장 높은 분야 중 하나입니다. AI가 작성한 코드의 정확성, 효율성, 가독성을 평가합니다. 평가 항목정확성 — 코드가 실제로 작동하는가? 엣지 케이스 처리는?효율성 — 시간 복잡도, 공간 복잡도가 최적인가?가독성 — 변수명, 함수명, 주석이 적절한가?베스트 프랙티스 — 해당 언어의 관용적 코딩 스타일을 따르는가?보안 — SQL Injection, XSS 같은 보안 취약점은 없는가? 실제 작업AI가 리스트에서 중복 제거하는 파이썬 함수를 만들어줘"라는 요청에 답변합니다. 작업자는 코드를 직접 실행해보고, 다양한 입력값(빈 리스트, None, 중첩 리스트 등)에서도 정상 동작하는지 확인 후 점수를 매깁니다. 진입 조건코딩 백그라운드가 있으시면 추천합니다. 일반 데이터 라벨링 단가의 2~3배 받을 수 있습니다. 영어 + 프로그래밍 경력이 필수입니다. 주로 어디서 만나나Turing(튜링), Outlier 일부 프로젝트, xAI16. Reasoning / Step-by-step Evaluation — 추론 과정 평가AI가 답에 이르는 과정(수학 풀이, 논리 추론)을 단계별로 평가하는 작업입니다. 최종 답이 맞아도 과정이 틀리면 감점입니다. 실제 작업 예시 — 수학 문제문제: 3, 5, 7, 11, 13의 다음 소수는?AI 답: 17입니다. 풀이 과정: 소수는 1과 자기 자신으로만 나누어지는 수입니다. 13 이후로 14(2의 배수), 15(3의 배수), 16(2의 배수)는 모두 합성수이고, 17은 1과 17로만 나누어지므로 소수입니다.평가자는 (1) 답이 맞는지, (2) 풀이 단계 각각이 논리적으로 옳은지, (3) 빠진 단계는 없는지 확인합니다. 진입 조건수학·과학·논리 백그라운드가 있는 분께 유리합니다. STEM 전공자라면 시급이 매우 높은 편입니다. 주로 어디서 만나나Outlier (Math/Reasoning 트랙), Mercor, Welodata17. Voice Acting / Voice Synthesis — 음성 합성 평가AI가 자연스러운 감정 표현 음성을 만들도록, 사람이 직접 연기해서 데이터를 제공하는 작업입니다. 기존 음성 전사의 한 단계 진화 버전입니다. 실제 작업 예시스크립트가 주어집니다. 예: 오늘 정말 신나는 일이 있었어! 드디어 시험에 합격했거든.작업자는 이 문장을 다음 감정 톤으로 각각 녹음합니다.기쁨 / 행복놀람긴장 / 떨림차분함 / 안도AI가 다양한 감정의 음성 데이터로 학습합니다. 진입 조건연기 경험이 도움이 되지만 필수는 아닙니다. 다만 책 읽듯이"하면 페일이 잦습니다. 감정 과잉이라 싶을 정도로 살려야 통과합니다. 주로 어디서 만나나Babel Audio(Emotion VA), Withspout, Turing 보이스 트랙⚠️ 주의통과 기준이 까다로워서 다수가 떨어집니다. 마이크 환경도 좋아야 합니다.18. Function Call / Agent Evaluation — AI 에이전트 평가AI Agent 시대의 핵심 작업입니다. AI가 도구(캘린더 API, 검색 함수, 결제 API 등)를 제대로 호출하는지 평가합니다. 실제 작업 예시사용자: 내일 오후 3시에 회의 잡아줘. 참석자는 김부장님과 강남웸블리 이대리야.AI가 다음과 같이 함수를 호출했다고 가정합니다.create_calendar_event(title=회의, date=2026-06-08, time=15:00, attendees=[김부장, 이대리])작업자는 다음을 평가합니다.올바른 함수를 호출했는가?파라미터가 모두 정확한가? (날짜·시간·참석자)빠진 파라미터는 없는가? (예: 회의 장소)불필요한 함수 호출은 없는가? 주로 어디서 만나나Alignerr(2026년 5월부터 신규 시작), Turing 시급매우 높은 편입니다. 19. Safety / Red Teaming — AI 안전성 평가AI가 위험하거나 부적절한 답변을 하는지 일부러 유도해보고 분류하는 작업입니다. AI를 일부러 깨뜨려 보는"역할이라고 보시면 됩니다. 실제 작업 예시작업자가 AI에게 다음과 같은 질문들을 던집니다.위험한 행동을 묻는 질문 → AI가 거절하는지?편향된 답변을 유도하는 질문 → AI가 중립을 유지하는지?개인정보를 유출하도록 유도 → AI가 보호 정책을 지키는지?미묘하게 우회된 위험 요청 → AI가 알아차리는지?AI의 반응을 안전 / 위험 / 부분적 위험"으로 분류하고, 위험한 경우 어떻게 개선해야 하는지 코멘트를 답니다. 주로 어디서 만나나Welodata Safety, Outlier 일부 프로젝트, RWS의 메타 작업에서도 진행됩니다. 데이터라벨링 부업 실전 팁1. 초보자 추천 시작 순서처음 시작하시는 분께 이 순서를 추천드립니다.1단계 — Needs Met / Page Quality : 기본 검색 평가 작업으로 AI 평가에 대한 감 잡기2단계 — Sentiment Analysis, NER : 비교적 쉬운 텍스트 분류 작업3단계 — Response Comparison (RLHF) : 자신감 생기면 신규 LLM 평가 작업에 도전4단계 — Code/Reasoning 등 전문 분야 : 백그라운드 있으시면 시급 높은 곳으로2. 품질 관리 노하우처음엔 가이드라인을 귀찮아도 공부한다는 느낌으로 여러 번 읽어보시고, 애매할 때는 너무 모험하지 말고 보수적으로 평가하는 것이 안전합니다. 일관성이 제일 중요합니다. 왜 떨어졌는지 모르겠는데 fail이 떴다"라는 후기가 많습니다. 재시험 기회가 오는 경우도 많으니 가이드를 다시 정독한 뒤 도전하세요.3. 카테고리별 한국인 작업 비중한국어 작업자 입장에서 일감이 많은 카테고리 순으로 정리하면 다음과 같습니다.높음 : Response Comparison, Needs Met, Transcription(음성 전사), Page Quality중간 : NER, Sentiment Analysis, Voice Acting, Quality Rating낮음 (영어 필수) : Code Evaluation, Reasoning, Multimodal, Function Call4. 장기적 접근 전략한 플랫폼에서 작업을 잘 진행하다가도 갑자기 프로젝트가 종료되거나 자격이 해제되는 경우가 많이 있습니다. 그래서 동시에 여러 플랫폼에 등록해두시는 것을 강력히 추천합니다. 꾸준히 좋은 품질을 유지하다 보면 더 좋은 프로젝트 기회가 많이 생기는 구조입니다.여기까지 데이터라벨링 부업의 19가지 작업 카테고리를 정리해봤습니다. 처음 시작하시는 분들이 AI 데이터 라벨링 부업이 도대체 어떤 일인지"감 잡으시는 데 도움이 되었으면 좋겠습니다.작년에 잘 되던 작업이 안 되는 분, 일이 계속 있는가 궁금하셨던 분들은 PART 2의 신규 카테고리(Response Comparison, Code Evaluation, Function Call 등)에 도전해보시는 것을 추천드립니다. 시장의 메인이 이쪽으로 옮겨갔습니다.데이터라벨링 부업 사이트 총정리 한국인이 가입 가능한 60곳 + 별점 정리 (2026.6월 기준) 안녕하세요. 20...관련 글에서는 그럼 어떤 플랫폼에서 이 작업들을 받을 수 있는지"— 작년부터 직접 가입하고 작업해본 약 60곳의 플랫폼을 별점·후기와 함께 정리해뒀습니다. Outlier(아웃라이어), Data Annotation, Oneforma(원포마), Babel Audio(바벨오디오), Turing(튜링), Prolific, RWS, Telus(텔루스), Clickworker, CloudResearch, Mercor, Appen 등 한국인이 가입 가능한 곳을 모두 다룹니다. 같이 보시면 본인에게 맞는 플랫폼 찾기가 훨씬 수월하실 것입니다. 궁금하신 카테고리나 플랫폼이 있으시면 댓글로 편하게 남겨주세요.
