본문으로 건너뛰기

변경 내역

API와 MCP에 추가되거나 바뀐 기능을 최신순으로 정리합니다. 별도 안내가 없으면 모든 변경은 하위 호환됩니다(기존 요청은 그대로 동작).

2026-08-03

비동기 작업의 최종 차감 크레딧 — GET /v1/jobs/{job_id} 응답에 charge 추가

이미지·영상·음성 인식처럼 job_id를 받는 작업이 결국 얼마를 썼는지 확인할 방법이 없었습니다. GET /v1/usage에는 job_id가 없고, 비동기 작업은 접수·완료 두 번에 나눠 과금돼 사용 내역에서 두 건으로 흩어지기 때문입니다.

  • API: GET /v1/jobs/{job_id} 응답에 charge 필드 추가 — 그 작업에 대해 지금까지 차감된 크레딧 총액(접수분 + 완료 정산분)입니다.
  • statussucceeded가 된 뒤의 값이 최종 금액입니다. 아직 processing이면 접수 시점 차감분만 반영된 중간값입니다.
  • failed면 접수 시 차감분이 환불되므로 charge0 입니다.
  • MCP: get_job 도구도 같은 응답을 그대로 전달하므로 charge가 함께 옵니다.
  • 기존 작업 기록에도 소급 적용되어 있습니다(이미 정산된 금액 기준으로 채움).
  • 필드 추가라 하위 호환입니다.

2026-07-25

ElevenLabs 음성 — 억양을 잇는 previous_text·next_text, 그리고 seed·apply_text_normalization

긴 대본을 문단(섹션)으로 나눠 음성을 만들면 문단마다 억양이 초기화돼 끊겨 들렸습니다. 이제 각 호출에 앞뒤 문맥을 함께 보내 억양을 이어 줄 수 있습니다.

  • API: POST /v1/audio/speech에 선택 필드 previous_text·next_text 추가. 앞 문단의 마지막 문장과 다음 문단의 첫 문장을 넣으면 됩니다.
  • MCP: text_to_speech 도구에 선택 인자 previous_text·next_text 추가.
  • 두 값은 읽히지 않습니다 — 억양·속도에만 반영되는 문맥입니다.
  • 앞 호출의 결과가 아니라 원문만 필요하므로, 섹션을 동시에(병렬로) 요청해도 됩니다.
  • ⚠️ voice_modeleleven_v3면 쓸 수 없습니다(업스트림 거부) — eleven_multilingual_v2·eleven_flash_v2_5에서 동작하며, v3로 보내면 422로 안내합니다.

함께 추가된 선택 필드(API·MCP 공통, 역시 ElevenLabs 전용):

  • seed(0~4294967295): 같은 seed·같은 옵션이면 같은 음성이 나옵니다(최대한). 마음에 든 결과를 나중에 다시 만들거나, 한 문단만 다시 뽑을 때 목소리 톤을 유지하는 데 씁니다.
  • apply_text_normalization(auto·on·off): 숫자·날짜·약어를 풀어 읽을지 정합니다.

위 네 필드는 모두 ElevenLabs(modoo-tts-eleven) 전용이라 minimax에 보내면 422입니다.

2026-07-22

이미지 size 전 모델 지원 · 음악 audio_setting 추가

  • 이미지 size: 이전에는 modoo-image-gpt·modoo-image-gpt-edit에 보낸 size가 무시되고 auto로 고정됐습니다. 이제 네 가지 값(auto·1024x1024·1536x1024· 1024x1536)을 그대로 씁니다. 표기법은 계열마다 다릅니다 — GPT 계열은 x, modoo-image-z·Qwen 수정 모델은 너비*높이(*). 허용 목록에 없는 값은 이제 업스트림 오류 대신 명확한 422로 응답합니다(모델별 허용값은 API 레퍼런스 참고).
  • 음악 audio_setting: POST /v1/audio/music에 선택 필드 audio_setting 추가 — sample_rate·bitrate·format. 넣지 않은 항목은 기존 기본값 그대로입니다. lyrics(1~3500자)·prompt(2000자 이하)·model(music-2.5·music-2.0) 길이/값 제한도 요청 단계에서 검증합니다.
  • MCP: edit_image 도구에 선택 인자 size 추가.
  • 문서 정정: modoo-image-z 예제의 1024x10241024*1024(잘못된 표기였습니다). 음악 요청의 model은 모두의창업 모델 ID가 아니라 엔진 버전이라는 설명 추가 (모델 ID는 항상 modoo-music).

2026-07-15

WAN 2.7 이미지→영상 — 첫→끝 프레임 보간 및 추가 입력

modoo-video-i2v(WAN 2.7)에 첫→끝 프레임 보간을 비롯한 선택 입력이 추가되었습니다. 모두 image_url과 동일하게 https 주소만 받고, modoo-video-i2v(WAN 2.7) 전용이며 다른 모델에 보내면 422입니다.

  • API: POST /v1/videos/generations에 선택 필드 추가 — end_image_url(끝 프레임 → 첫→끝 보간), driving_audio_url(움직임을 구동할 오디오, 예: 말하는 아바타), first_clip_url(이어서 확장할 기존 영상 클립).
  • MCP: animate_image 도구에 선택 인자 end_image_url·driving_audio_url· first_clip_url 추가.
  • 모두 하위 호환이며, 게이트웨이 스키마 기반 배선입니다.

2026-07-13

모델 추가 — GPT-5.4 mini/nano · HappyHorse 1.1 영상 · 음악 생성

텍스트·영상·음악 모델이 한 번에 추가되었습니다. 모두 기존 요청 형식을 그대로 따르며, 새 model 값이나 새 엔드포인트만 쓰면 됩니다(기존 호출은 변경 없이 동작).

  • 텍스트 (GPT-5.4 mini/nano): 새 모델 ID modoo-text-pro-mini(GPT-5.4 mini)· modoo-text-pro-nano(GPT-5.4 nano). 기존 POST /v1/chat/completions(동기·스트리밍)에서 model 값만 바꿔 쓰면 됩니다(새 엔드포인트·MCP 도구 없음).
  • 영상 (HappyHorse 1.1): 새 모델 ID modoo-video-happyhorse-t2v(텍스트→영상)· -i2v(이미지→영상)·-r2v(참조→영상). POST /v1/videos/generations에 HappyHorse 전용 선택 옵션 resolution·ratio·duration·watermark·seed 추가. r2v는 reference_image_urls(캐릭터 참조 이미지 1~9장)가 필수입니다.
  • 음악 생성: 새 모델 ID modoo-music와 새 엔드포인트 POST /v1/audio/music(비동기). lyrics(필수)·model(선택, 기본 music-2.5·music-2.0prompt(선택)로 노래를 만들고, job_id로 폴링하면 완료 후 result.audio_url에 노래 파일 주소가 담깁니다.
  • MCP: 새 도구 reference_to_video(참조→영상)·generate_music(음악 생성) 추가. 기존 generate_video·animate_image 도구도 HappyHorse model 옵션과 resolution·ratio·duration·watermark·seed 옵션을 받도록 확장되었습니다. MCP 클라이언트는 접속 시 도구 목록을 자동으로 갱신하므로 재설치·재설정이 필요 없습니다.

자세한 파라미터는 모델 안내, API 레퍼런스, MCP 연동을 참고하세요.

ElevenLabs 음성(TTS) 지원 — text_to_speech / POST /v1/audio/speech

음성 합성에서 ElevenLabs(modoo-tts-eleven)를 선택할 수 있게 되었습니다. 기존 minimax(modoo-tts-minimax)가 기본값이라, 이전 호출은 변경 없이 동작합니다.

  • 모델 선택: model 필드 추가 — modoo-tts-minimax(기본) 또는 modoo-tts-eleven.
  • ElevenLabs 세부 옵션:
    • voice_id — ElevenLabs 계정의 음성 id (ElevenLabs 사용 시 필수).
    • voice_modeleleven_flash_v2_5 · eleven_multilingual_v2(기본) · eleven_v3.
    • voice_settingsstability · similarity_boost · style · speed · use_speaker_boost.
    • language_code(예: ko), output_format(예: mp3_44100_128).
  • MCP: text_to_speech 도구에 위 옵션이 그대로 추가되었습니다. MCP 클라이언트는 접속 시 도구 목록을 자동으로 갱신하므로 재설치·재설정이 필요 없습니다.
curl https://modoo.devdive.me/v1/audio/speech \
-H "Authorization: Bearer sk-modoo-..." \
-H "Content-Type: application/json" \
-d '{
"text": "안녕하세요, 모두의창업입니다.",
"model": "modoo-tts-eleven",
"voice_id": "EXAVITQu4vr4xnSDxMaL",
"voice_model": "eleven_multilingual_v2",
"voice_settings": { "stability": 0.5, "similarity_boost": 0.75 }
}'

자세한 파라미터는 API 레퍼런스MCP 연동을 참고하세요.