AI의 진전은 쓸모없는 데이터가 과다해서 느려지고 있다—그것이 너무 많기 때문이다

AI의 진전은 쓸모없는 데이터가 과다해서 느려지고 있다—그것이 너무 많기 때문이다

17 hardware

핵심 결론: ChatGPT에서 “실제” 로봇으로 전환하려면 단순히 대규모 데이터 세트가 아니라 고품질의 관련 정보가 필요합니다.

포춘은 AI 산업이 물리적 지능과 주변 세계 모델링이라는 새로운 시대의 문턱에 서 있다고 강조합니다. 이러한 시스템은 실제 공간에서 길을 찾고, 빨래를 접거나 복잡한 외과 수술을 돕는 등 현실 세계에서 행동할 수 있어야 합니다. 이를 위해서는 단순히 “로드 가능한” 데이터가 아니라 풍부하고 다면적인 정보 세트가 필요합니다.

데이터 품질이 중요한 이유
1. 과잉 및 무용성

AI에 대한 열풍 속에서 Scale AI, Surge AI, Mercor 등 많은 스타트업이 최대한 많은 데이터를 수집하려고 합니다. 이는 모델 학습에 기여하지 않는 “빈 파일”의 방대한 축적을 초래합니다. 연구자들이 이를 필터링하지 못하면 물리적 AI의 잠재력이 낭비됩니다.

2. 다차원 과제의 복잡성

복잡한 세계를 이해하려면 더 많은 데이터가 필요하지만, 이 데이터는 극히 접근하기 어렵습니다. 따라서 엔지니어들은 가상 재구성을 통해 실제 시나리오를 모델링하여 로봇과 자율 주행 차량을 위한 학습 예시를 생성합니다.

3. 저품질 세트의 위험

부실한 데이터는 예측 불가능한 결과를 초래할 수 있습니다. 예로 OpenAI 비디오 애플리케이션 Sora 지원 중단이 있습니다: 모델이 물리학을 처리하지 못해 현실적인 예측이 어려웠습니다.

문제 해결 방안
- 정리 도구

머신러닝 전문가들은 자동으로 불필요한 데이터를 제거하고, 분석하며, 정규화하고 수정하는 기술이 필요합니다. 이를 통해 “노이즈”에서 귀중한 정보를 추출할 수 있습니다.

- 품질에 집중

현재 제한 요인은 고품질 데이터 부족입니다. 이 점을 가장 먼저 인식하고 수집 및 처리를 투자하기 시작하는 기업들이 실제로 동작하는 AI 시스템을 만드는 데 선두가 될 것입니다.

따라서 텍스트 모델에서 현실 세계에서 행동할 수 있는 로봇으로의 전환은 학습 데이터 품질에 대한 체계적 접근 없이는 불가능합니다. 포춘은 바로 이 요인이 물리적 지능의 미래를 결정짓는 핵심 요소가 될 것이라고 강조합니다

댓글 (0)

의견을 남겨 주세요. 예의를 지키고 주제에서 벗어나지 말아 주세요.

아직 댓글이 없습니다. 댓글을 남기고 의견을 공유해 주세요!

댓글을 남기려면 로그인해 주세요.

댓글을 남기려면 로그인