이제 모델 선택 기준은 지능보다 속도

1 week ago 15

코딩·리서치·슬라이드 설계·데이터베이스 분석에서는 Opus 4.6 수준의 지능이면 대부분 충분해, 일상용 모델의 선택 기준이 순수 지능에서 속도로 이동함 출력 속도는 약 100~200tok/s일 때 빠르게 느껴지고, 50tok/s 아래에서는 답답하며, 200tok/s를 넘으면 사람이 훑어 읽는 속도보다 빨라 오히려 낯설 수 있음 같은 오픈 웨이트 모델인 GLM5.2도 제공자에 따라 30tok/s 미만부터 129tok/s까지 차이가 나면서, 서빙 속도 경쟁이 오픈 웨이트 생태계의 새로운 장점으로 부상함 모델 출력을 50tok/s에서 250tok/s로 5배 높여도 도구 호출과 사람의 판단 시간이 그대로라면 전체 턴은 약 2배만 빨라져, Amdahl의 법칙에 따른 병목이 남음 GLM5.2 가격은 Opus의 5% 수준인 $0.42/$1.32/MTok까지 내려갔으며, HBM4 기반 차세대 GPU가 배치되면 2027년에는 합리적인 가격의 고품질 모델이 500tok/s 이상으로 동작할 가능성이 있음 지능보다 속도가 중요해진 기준점 현재 약 Opus 4.6 수준의 모델은 코딩, 리서치 종합, 슬라이드 덱 설계, 여러 데이터베이스를 대상으로 한 분석 등 대부분의 일상 작업에 충분히 영리함 Fable은 미국 정부 셧다운 이후 추가 가드레일과 함께 돌아왔지만 체감 속도가 매우 느려, 빠르게 Opus로 다시 전환하게 됨 소프트웨어는 디자인이 뛰어나도 느리면 사용하기 불편하고, 기본적인 제품이라도 매우 빠르면 뛰어난 실용성을 체감할 수 있음 Craigslist와 Hacker News는 외관이 오래됐지만 반응성이 높음 홈페이지 하나를 렌더링하려고 React 30MB를 전송하는 일반적인 SPA는 디자인과 제품에 많은 비용을 들였더라도 사용이 답답할 수 있음 이전에는 지능 기준을 통과한 선택지가 소수의 크고 느린 모델뿐이어서, 빠르지만 결과가 망가져 작업을 다시 해야 하는 모델을 고를 이유가 적었음 이제 여러 모델이 충분한 지능 기준을 넘어서면서 속도 자체가 선택을 좌우하는 조건이 됨 100tok/s가 새로운 100ms인가 프런티어 모델이 30~60tok/s로 동작하던 시기에는 코딩 에이전트가 전화 접속처럼 느껴졌지만, 모델 속도는 예상보다 빠르게 개선됨 사람에게 약 100ms가 즉각적인 반응처럼 느껴지듯, 모델의 100tok/s 출력은 사람이 훑어 읽으며 따라갈 수 있는 속도의 기준에 가까움 체감 속도는 대략 다음과 같음 100~200t...

Read Entire Article