변경 내역
API와 MCP에 추가되거나 바뀐 기능을 최신순으로 정리합니다. 별도 안내가 없으면 모든 변경은 하위 호환됩니다(기존 요청은 그대로 동작).
2026-10-07
GPT Image 2.5 추가, 이미지 생성 기본 모델 변경
modoo-image-gpt-2-5-flare— GPT Image 2.5 Flare(빠른 생성). 일상 작업·대량 생성에 추천.modoo-image-gpt-2-5-sunburst— GPT Image 2.5 Sunburst(최고 품질). 복잡한 디테일·로고처럼 정밀함이 필요할 때. Flare보다 느립니다.- 두 모델 모두
n(1~10)·size(auto·1024x1024·1536x1024·1024x1536)·quality를modoo-image-gpt와 똑같이 받습니다. - 기본 모델 변경:
POST /v1/images/generations와 MCPgenerate_image에서model을 생략하면 이제modoo-image-z대신modoo-image-gpt-2-5-flare로 생성합니다. GPT Image는 크레딧이 더 들고 모델별 RPM이 5이니, 빠르 고 저렴한 생성이 필요하면"model": "modoo-image-z"를 지정하세요. - 기존 모델 ID의 매핑은 그대로입니다(
modoo-image-gpt는 계속 GPT Image 2).
2026-09-14
새 모델 — GPT-5.5·Claude Sonnet 5, WAN 3.0 영상, 영상 수정, 동작 따라 하기
텍스트 (POST /v1/chat/completions, 동기·스트리밍)
modoo-text-5-5— OpenAI GPT-5.5modoo-claude-sonnet-5— Anthropic Claude Sonnet 5- 기존 모델 ID의 매핑은 그대로입니다(
modoo-claude-sonnet은 계속 Sonnet 4.6). - 두 모델은 모델별 RPM이 공개되지 않아 API 키·계정 기본 한도만 적용됩니다.
영상 (POST /v1/videos/generations, 비동기)
modoo-video-wan30-t2v— WAN 3.0 텍스트→영상.resolution에480P추가, 새 옵션audio(소리 켜기/끄기).negative_prompt·prompt_extend는 받지 않습니다.modoo-video-wan30-r2v— WAN 3.0 참조→영상. 첫/끝 프레임(image_url·end_image_url)과 참조 이미지·영상·오디오(reference_image_urls·reference_video_urls·reference_audio_urls) 중 하나 이상을 보냅니다.prompt는 선택.modoo-video-happyhorse-edit— HappyHorse 1.0 영상 수정.prompt와 원본 영상video_url이 필수, 참조 이미지·audio_setting(auto·origin)은 선택.modoo-video-wan-action— 사진 속 인물(image_url)이 영상(video_url)의 동작을 따라 합니다.prompt없음,mode(wan-std·wan-pro).- MCP:
generate_video에modoo-video-wan30-t2v·audio,reference_to_video에 WAN 3.0 입력이 추가되고, 새 도구edit_video·transfer_motion이 생겼습니다.
이미지
modoo-image-gpt·modoo-image-gpt-edit에quality(auto·low·medium·high) 추가. 이전에는 항상auto였고, 생략하면 지금도auto입니다. 다른 이미지 모델에 보내면 422입니다.- MCP:
generate_image·edit_image에quality인자 추가.
⚠️ 달라진 점
- 영상 모델이 받지 않는 입력을 보내면 422 로 알려 줍니다. 특히
reference_image_urls는 이전엔 받지 않는 모델(modoo-video등)에서 조용히 무시됐지만 이제 422입니다. 영상 입력 관련 422 메시지도... is not supported by '<모델>'형식으로 통일됐습니다.
2026-08-03
비동기 작업의 최종 차감 크레딧 — GET /v1/jobs/{job_id} 응답에 charge 추가
이미지·영상·음성 인식처럼 job_id를 받는 작업이 결국 얼마를 썼는지 확인할 방법이
없었습니다. GET /v1/usage에는 job_id가 없고, 비동기 작업은 접수·완료 두 번에 나눠
과금돼 사용 내역에서 두 건으로 흩어지기 때문입니다.
- API:
GET /v1/jobs/{job_id}응답에charge필드 추가 — 그 작업에 대해 지금까지 차감된 크레딧 총액(접수분 + 완료 정산분)입니다. status가succeeded가 된 뒤의 값이 최종 금액입니다. 아직processing이면 접수 시점 차감분만 반영된 중간값입니다.failed면 접수 시 차감분이 환불되므로charge는0입니다.- MCP:
get_job도구도 같은 응답을 그대로 전달하므로charge가 함께 옵니다. - 기존 작업 기록에도 소급 적용되어 있습니다(이미 정산된 금액 기준으로 채움).
- 필드 추가라 하위 호환입니다.
2026-07-25
ElevenLabs 음성 — 억양을 잇는 previous_text·next_text, 그리고 seed·apply_text_normalization
긴 대본을 문단(섹션)으로 나눠 음성을 만들면 문단마다 억양이 초기화돼 끊겨 들렸습니다. 이제 각 호출에 앞뒤 문맥을 함께 보내 억양을 이어 줄 수 있습니다.
- API:
POST /v1/audio/speech에 선택 필드previous_text·next_text추가. 앞 문단의 마지막 문장과 다음 문단의 첫 문장을 넣으면 됩니다. - MCP:
text_to_speech도구에 선택 인자previous_text·next_text추가. - 두 값은 읽히지 않습니다 — 억양·속도에만 반영되는 문맥입니다.
- 앞 호출의 결과가 아니라 원문만 필요하므로, 섹션을 동시에(병렬로) 요청해도 됩니다.
- ⚠️
voice_model이eleven_v3면 쓸 수 없습니다(업스트림 거부) —eleven_multilingual_v2·eleven_flash_v2_5에서 동작하며, v3로 보내면 422