/ 뉴스 / 미라 무라티의 랩, 예산이 부족한 개발자를 위해 구축된 간결한 오픈 모델 Inkling-Small 공개
오픈소스 AI

미라 무라티의 랩, 예산이 부족한 개발자를 위해 구축된 간결한 오픈 모델 Inkling-Small 공개

2026년 7월 31일6 분 소요
미라 무라티의 랩, 예산이 부족한 개발자를 위해 구축된 간결한 오픈 모델 Inkling-Small 공개

뉴스 요약

전 OpenAI 최고 기술 책임자 미라 무라티가 설립한 AI 연구 회사 Thinking Machines Lab이 2026년 7월 15일 태평양 표준시 오전 9시에 첫 오픈 웨이트 모델 패밀리를 공개했다. Inkling이라는 플래그십 릴리스는 9,750억 개 파라미터를 갖춘 멀티모달 mixture-of-experts 모델이며, 대규모 GPU 클러스터에 접근할 수 없지만 강력한 추론 성능을 원하는 팀을 겨냥한 더 가벼운 Inkling-Small과 함께 출시되었다. 회사는 리더보드 최상위를 노리기보다는 자체 제품을 위해 AI 시스템을 커스터마이징하고 파인튜닝하려는 개발자에게 유연한 출발점으로 두 모델을 포지셔닝했다.

Inkling 및 Inkling-Small의 정체성

Inkling은 256개의 라우팅 전문가와 레이어당 2개의 공유 전문가를 갖춘 mixture-of-experts 트랜스포머 아키텍처를 기반으로 구축되었으며, 주어진 토큰마다 6개의 라우팅 전문가가 활성화된다. 이 설계는 전체 모델에 9,750억 개의 총 파라미터를 부여하는 동시에 추론 중에는 약 410억 개만 활성화하여 컴퓨팅 비용을 관리 가능한 수준으로 유지한다. Inkling-Small은 축소된 규모로 동일한 아키텍처를 따른다. 총 2,760억 개의 파라미터를 갖추고 있으며 토큰당 약 120억 개가 활성화된다. 두 모델 모두 최대 100만 토큰의 컨텍스트 창을 지원하며 텍스트, 이미지, 오디오, 비디오를 포괄하는 총 45조 개의 토큰으로 학습되었다.

특히 Inkling-Small은 출시 시 기술 프리뷰로 공유되었다. 추가 안전 및 품질 테스트를 위해 전체 다운로드 가능한 웨이트는 잠시 보류되었지만, 개발자는 이미 Thinking Machines의 커스터마이징 플랫폼인 Tinker를 통해 이를 파인튜닝할 수 있다.

비용 제어를 위한 "사고 노력" 다이얼

Inkling 패밀리의 가장 독특한 기능 중 하나는 시스템 메시지를 통해 조정 가능한 제어 가능한 "사고 노력" 설정으로, 개발자가 추론 깊이를 속도 및 토큰 비용과 교환할 수 있게 해준다. 회사 연구원들은 이 접근 방식을 통해 Inkling이 Terminal Bench 2.1과 같은 에이전트 코딩 벤치마크에서 Nvidia의 Nemotron 3 Ultra 모델이 사용하는 토큰의 약 3분의 1만 사용하면서도 경쟁 시스템과 맞먹는 성능을 보였다고 보고했다. 특히 Inkling-Small의 경우, 효율적인 추론 설계는 코딩 보조, 자동 채점 시스템, 더 작은 다운스트림 모델을 위한 합성 학습 데이터 생성 등 지연 시간에 민감하고 예산을 고려하는 워크로드를 명확히 겨냥하고 있다.

벤치마크 성능

최고 추론 노력 설정에서 Inkling은 GPQA Diamond에서 87.2%, AIME 2026에서 97.1%, 실제 코딩 능력을 측정하는 데 널리 사용되는 SWE-Bench Verified에서 77.6%의 점수를 기록했다. 멀티모달 평가에서는 비전 작업을 위한 MMMU Pro에서 73.5%, 오디오 이해를 위한 VoiceBench에서 91.4%에 도달했다. Thinking Machines는 Inkling-Small이 활성 파라미터의 3분의 1 미만을 사용함에도 불구하고 이러한 동일한 평가의 상당수에서 더 큰 모델에 뒤처지는 폭이 미미하며, 비전 및 오디오 점수는 일반적으로 풀 사이즈 모델과 1~3% 포인트 내의 차이를 보인다고 보고했다.

학습 접근 방식 및 안전 작업

Inkling 패밀리는 하이브리드 최적화 방식을 사용하여 학습되었다. 대형 웨이트 행렬에는 Muon 옵티마이저를, 나머지 파라미터에는 Adam을 적용한 후, 감독 미세 조정과 3,000만 회 이상의 롤아웃이 포함된 대규모 강화 학습을 진행했다. 회사는 보정에 특별한 중점을 두어, 결과가 해결된 실제 질문에 대해 모델을 학습시켜 확신에 차서 추측하는 대신 적절한 불확실성을 표현하도록 만들었다고 밝혔다. 안전 평가에는 적대적 레드팀 벤치마크가 포함되었으며, 여기서 Inkling은 StrongREJECT 테스트에서 98.6%를, FORTRESS 적대적 안전 제품군에서 78.0%를 기록했고 독립 테스터의 외부 검토도 함께 이루어졌다.

가용성 및 가격 책정

Inkling의 전체 웨이트는 현재 Hugging Face를 통해 다운로드할 수 있으며, 여기에는 Nvidia의 Blackwell 칩에 최적화된 압축 NVFP4 체크포인트가 포함된다. 또한 Together AI, Fireworks, Modal, Databricks, Baseten을 포함한 호스팅 파트너를 통해서도 모델에 접근할 수 있다. Thinking Machines는 Tinker를 통해 파인튜닝하는 개발자에게 한시적으로 50% 할인을 제공하며, Tinker 콘솔 내의 Inkling 플레이그라운드에 대한 무료 시간 제한 액세스도 함께 제공한다. Inkling-Small의 전체 웨이트는 추가 테스트가 완료되는 대로 뒤따를 예정이다.

업계 맥락

이번 릴리스는 이전의 Tinker 파인튜닝 플랫폼 데뷔에 이어 Thinking Machines의 공개 제품 라인업에 두 번째 진입작을 추가한다. 회사 연구원들은 Inkling이 오픈이든 클로즈드든 사용 가능한 가장 강력한 단일 모델이 되는 것을 목표로 하지 않는다고 솔직하게 밝혔다. 대신, 개발자, 대학, 연구소에 특수 과학, 코딩 및 추론 애플리케이션에 맞게 조정할 수 있는 균형 잡히고 효율적인 기반을 제공하는 데 중점을 두고 있다. 초기 기업의 관심은 투자 회사인 Bridgewater Associates와의 협업을 통해 강조되었는데, 이 회사는 Inkling을 금융 추론 벤치마크에 적용하여 비교 가능한 독점 모델의 컴퓨팅 비용의 극히 일부만으로 강력한 결과를 보고했다.

오픈소스 AI멀티모달 모델