본문 바로가기

주메뉴 바로가기

전체메뉴

미디어룸

오늘을 넘어 미래의 가치를 만드는 더존ICT그룹의 소식을 만나보세요.

같은 모델도 하드웨어마다 속도 수치가 달랐다, 비교 전 측정 조건 확인이 필요하다.

AI 트렌드2026.09.18
AI 트렌드

넘쳐나는 전 세계 AI 이슈, 핵심만 골라 ‘ONE AI’가 브리핑해 드립니다

01 / 05파생 모델 · 구동 조건
같은 기반 모델에서 용량과 토큰 사용을 줄이는 최적화가 각각 공개됐다
WHAT HAPPENED

Qwen3.8-27B를 기반으로 한 삼진법 가중치 모델 Ternary Bonsai 2 27B가 공개됐습니다. 각 가중치를 세 가지 값으로만 표현해 FP16보다 9배 작은 6GB 미만 크기로 줄였고, 지능의 98.2%를 유지하며 브라우저에서 WebGPU로 실행할 수 있다고 제시됐습니다①②.

같은 기반 모델의 파생판인 Swift Qwen 3.8 27B는 모델이 필요 이상으로 길게 생각하는 오버씽킹 패턴을 억제해 토큰 사용량을 58.3% 줄이고 속도를 1.95배 높였다고 제시됐으며, 허깅페이스 트렌딩 9위와 파인튜닝 1위에 오르고 10만 다운로드를 넘었습니다③.

하드웨어별 측정 결과도 함께 공유됐습니다. AMD Radeon R9700 한 장에서는 단일 요청 153 tok/s, 동시 8개 요청 470 tok/s, 프리필 3,619 tok/s가 제시됐고④, 애플 M5 Ultra에서는 모델 용량을 줄이는 q4 양자화 기준으로 50 tok/s가 확인됐습니다⑤.

WHAT IT MEANS

같은 기반 모델이라도 무엇을 줄였는지에 따라 얻는 이득의 종류가 다릅니다.

한쪽은 모델이 차지하는 용량 자체를 줄여 더 작은 장비에서 돌릴 수 있게 한 결과이고, 다른 한쪽은 답을 만들 때 쓰는 토큰 사용량을 줄인 결과입니다. 두 수치는 같은 대상을 줄인 것이 아니어서 하나의 개선폭으로 합쳐 읽을 수 없습니다. 속도 수치 역시 그래픽카드 종류, 동시 요청 수, 양자화 설정에 따라 각각 다른 값으로 제시됐습니다.

도입을 검토할 때 저장 공간이 부족한지, 응답에 드는 토큰 비용이 부담인지, 처리 대수가 문제인지를 먼저 구분하고 그에 맞는 수치를 비교 기준으로 둘 수 있습니다.

02 / 05특화 모델 · 전용 평가
용도를 좁힌 소형 모델이 각자의 전용 평가에서 상위 점수를 기록했다
WHAT HAPPENED

Cactus Needle 3는 121M 파라미터에 8~29MB 크기로 압축된 온디바이스 자동화 전용 모델로, 대화 기능을 빼고 함수 호출과 구조화 추출에만 범위를 좁혔습니다. Monarch Hadamard MLP와 해시 기반 엔그램 구조를 사용해 연산량을 100 MFLOPs로 줄였고, 모바일 명령어 벤치마크에서 86.0점을 기록해 LFM2.5 1.2B의 82.4점과 Qwen3.5 0.8B의 76.0점을 앞섰습니다①.

텐센트의 WeVisDoc은 Qwen3-VL을 파인튜닝한 문서 파싱 전용 모델로, 문서 처리 평가인 OmniDocBench v1.6에서 95.38점을 기록해 비교 모델 중 1위로 제시됐습니다②.

스마트폰에서 60개 작업을 수행하는 AndroidLife 벤치마크에서는 Qwen 계열 모델이 56.7%의 성공률로 텍스트 모델 중 최고 점수를 기록했습니다③.

WHAT IT MEANS

모델을 고를 때 크기가 큰 쪽이 항상 유리한 것은 아니며, 평가가 어떤 작업을 대상으로 했는지가 결과를 가릅니다.

여기서 상위 점수를 기록한 모델들은 각각 모바일 명령 처리, 문서 파싱, 스마트폰 작업 수행이라는 서로 다른 평가에서 1위를 얻었습니다. 같은 순위 표현이라도 평가 대상이 다르므로 한 모델이 다른 작업에서도 앞선다는 의미로 읽을 수는 없습니다.

업무에 쓸 모델을 검토할 때 공개된 점수의 이름값보다 그 평가가 자사에서 실제로 시키려는 작업과 같은 종류인지를 확인 항목에 포함할 수 있습니다.

03 / 05연구 자동화 · 적용 사례
AI가 개발 작업에 관여한 정도가 서로 다른 형태의 수치로 공개됐다
WHAT HAPPENED

Anthropic은 프론티어 랩 내부에서 AI 개발 속도를 측정한 결과를 블로그로 공개하며, 6개월 전 거의 0%에 가까웠던 Claude 주도 R&D 비중이 현재 26%까지 올랐다고 밝혔습니다. 이는 조직 내부의 연구 업무를 기준으로 집계된 비중입니다①.

같은 날 Anthropic은 Claude가 직접 작성한 GPU 최적화 코드를 오픈소스로 공개했고, 30개 이상의 생물분자 모델에 적용한 결과 평균 약 4배의 속도 향상을 얻었다고 밝혔습니다②.

중국 AI 기업 GLM은 자사 모델을 활용해 자체 추론 인프라, 즉 모델을 실제로 서비스하는 시스템을 직접 구축한 과정을 공개했습니다③.

WHAT IT MEANS

AI가 개발에 얼마나 쓰였는지를 보여주는 수치가 하나의 기준으로 통일돼 있지 않습니다.

한쪽은 조직 안에서 AI가 주도한 업무의 비중이고, 다른 한쪽은 AI가 쓴 코드를 특정 모델군에 적용했을 때의 속도 배수이며, GLM 사례는 수치 없이 구축 과정을 공개한 것입니다. 세 가지는 측정 대상과 분모가 달라 하나의 성과 지표로 합산해 읽기 어렵습니다.

자사 도입 효과를 판단할 때도 업무 비중, 특정 작업의 처리 속도, 구축 사례 공개는 각각 다른 근거이므로 구분해서 볼 필요가 있습니다.

04 / 05모델 규모 · 칩 수요
중국 쪽 자료에서는 모델 규모 계획과 칩 수요가 함께 언급됐다
WHAT HAPPENED

최소 6~7개의 중국 AI 연구소가 향후 2년 내에 10조에서 40조 파라미터에 이르는 초대형 모델을 훈련하려는 계획을 세우고 있는 것으로 전해졌습니다. 이는 계획 단계로 알려진 내용이며, 실제 훈련 착수 여부는 공개된 자료만으로 확인하기 어렵습니다①.

화웨이는 자사 AI 칩에 대한 수요가 공급을 초과하고 있다고 밝히며 엔비디아에 대한 도전을 가속화하겠다는 입장을 드러냈습니다②.

WHAT IT MEANS

중국 AI 인프라와 관련해 공개된 내용은 앞으로의 계획과 현재의 수요 상황이라는 서로 다른 시점의 정보입니다.

모델 규모는 아직 훈련하려는 계획으로 전해진 수치이고, 칩 수요는 기업이 현재 상태로 밝힌 내용입니다. 두 내용이 같은 자료 묶음에서 다뤄졌더라도 확인 수준이 달라, 계획 수치를 이미 확보된 역량으로 읽지 않는 것이 정확합니다.

05 / 05로봇 시연 · 현장 배치
휴머노이드 로봇 소식이 시연 영상과 배치 단계라는 다른 근거로 나왔다
WHAT HAPPENED

Figure의 창업자 브렛 애드콕이 자사 로봇이 30개의 임대 주택에서 제로샷으로 작업을 수행하는 4시간 분량의 영상을 공개했습니다. 제로샷은 해당 가정의 환경을 따로 학습하지 않고 처음 방문한 공간에서 바로 작업하는 것을 뜻하며, 로봇은 구조와 가구 배치가 서로 다른 주택에서 물건 정리와 이동 등의 작업을 처리했습니다①②.

중국의 AGIBOT은 A3 Ultra 로봇을 대량 생산 단계에서 실제 현장 배치 단계로 전환하고 있다는 소식이 전해졌습니다③.

WHAT IT MEANS

휴머노이드 로봇의 진척을 보여주는 근거가 영상 시연과 생산·배치 단계라는 서로 다른 형태로 제시됐습니다.

Figure 사례에서 확인할 수 있는 것은 낯선 가정에서 별도 학습 없이 작업한 장면이고, AGIBOT 사례에서 확인할 수 있는 것은 제품이 생산에서 현장 투입으로 넘어가는 단계입니다. 영상은 수행 능력을, 단계 전환은 공급 진행 상황을 보여주므로 두 소식을 하나의 상용화 진도로 합쳐 읽기는 어렵습니다.

본 콘텐츠는 공개된 사실 및 정보를 바탕으로, 당사의 편집 기준에 따라 생성형 인공지능(AI)에 의해 생성되었습니다. 최종 내용은 원문 대조 및 검수를 거쳐 발행하며, 참고한 각 자료의 저작권은 해당 저작권자에게 있습니다.

구매상담
1688
5000