Skip to main content
MoAI-Agents

「미디어 크리에이터」 — 이미지·영상·오디오 생성 담당

검수자 · Goos Kim · 읽는 시간 7분 · 최종 업데이트 2026.08.07

콘텐츠에 이미지·영상·음성이 들어가면 퀄리티가 확 달라집니다. 하지만 생성 도구마다 프롬프트 문법이 다르고, 계정도 따로입니다. 미디어 크리에이터는 이 멀티모달 생성을 한 직원 안에 모아 둔 역할입니다. 스튜디오의 크리에이티브 디렉터처럼, 무엇을 만들지 정하고 알맞은 도구를 골라 호출합니다.

스킬은 13종입니다. Higgsfield 계열(media-higgsfield-*)은 이미지·영상에 더해 3D 메시(GLB)·오디오·완성 영상 분석, 10초 블록 조립형 설명 영상, 제품 촬영 10모드, 그리고 같은 인물·캐릭터를 여러 컷에 일관되게 넣는 참조 학습(Soul / Element)까지 다룹니다. 오디오 계열(media-audio-gen)은 ElevenLabs 음성 생성을, 프롬프트 빌더 계열(media-gpt-image-2 / media-gemini-3 / media-midjourney-v8 / media-codex-image)은 각 모델에 맞춘 완성 프롬프트를 만들어 줍니다. 이전 버전에서 마케터로부터 미디어 생성 도메인이 분리되어 신설되었습니다. Higgsfield·ElevenLabs MCP가 연동됩니다.

브랜드 톤과 시각 일관성이 중요한 작업인 만큼, 산출물이 브랜드에 맞는지 검수하는 직원이 붙어 있습니다.

flowchart LR
   A["요청
(제품 숏 영상 만들어줘)"] --> B["스킬 매칭"] B --> C["media-producer
이미지·영상·오디오 생성"] C --> D["media-brand-auditor
브랜드 정합 검수"] D --> E["산출물
(이미지·영상·음성)"]

스킬 카탈로그

media-* 계열 생성 스킬의 전체 목록입니다.

스킬 13종 — 아래 표는 마켓플레이스 정본(v1.1.0)에서 자동 생성됩니다.

스킬무엇을 해주나
media-audio-gen통합 오디오 생성 스킬. ElevenLabs MCP 기반 TTS(32개국어), 보이스 클로닝(1분 샘플), 다국어 더빙(립싱크), 효과음 생성을 지원. "목소리 생성", "TTS", "음성 합성", "보이스 클로닝", "더빙", "나레이션", "효과음", "AI 음성" 요청 시 사용.
media-codex-imagecodex CLI의 내장 image_gen 도구로 **gpt-image-2** 이미지를 생성합니다 — ChatGPT OAuth 인증으로 **API 키 불필요**, ChatGPT Plus/Team/Enterprise 구독 한도로 동작합니다. 다음과 같은 요청 시 사용하세요: - "codex로 이미지 만들어줘", "codex
media-gemini-3-image-promptGoogle Gemini 3 Pro Image (a.k.a. Nano Banana Pro) 전용 이미지 프롬프트 빌더. 사용자 자연어 한 줄 + AskUserQuestion 프리셋·미세조정으로 컨텍스트를 수집해 Google AI Developers 공식 가이드의 5-component 구조([Subject+Adj] doin
media-gpt-image-2-promptOpenAI GPT-image-2 모델 전용 이미지 프롬프트 텍스트 빌더. 사용자 자연어 한 줄 + AskUserQuestion 프리셋·미세조정 라운드로 컨텍스트를 수집하고, OpenAI Cookbook 공식 6-Block 구조(Subject·Action·Scene·Composition·Lighting·Style&Text
media-higgsfield-assetsHiggsfield MCP에서 이미지·영상 이외의 생성과 후처리를 다룹니다. 3D 메시(GLB) 생성·리깅·애니메이션, 오디오(효과음·앰비언스·음악·TTS), 완성 영상의 바이럴 점수 분석, 그리고 업스케일·리프레임·아웃페인팅· 배경 제거 같은 기존 에셋 후처리가 범위입니다. 다음과 같은 요청 시 사용하세요: - "이 사
media-higgsfield-coreHiggsfield MCP 이미지·영상 생성의 공유 코어. media-higgsfield-image / media-higgsfield-video가 로드하는 SSOT(single source of truth)로, 호출 스키마·라이브 카탈로그 조회 프로토콜·공통 크래프트 규칙(R1–R5)·인터뷰 슬롯·잡 수명주기를 정의합니다
media-higgsfield-explainerHiggsfield MCP로 내레이션이 깔린 비실사 설명 영상을 만듭니다. 10초 블록 단위로 내레이션 한 줄과 영상 한 컷을 짝지어 만든 뒤, 서버에서 순서대로 조립해 완성 MP4를 반환합니다. 다음과 같은 요청 시 사용하세요: - "이 주제로 설명 영상 만들어줘" - "이 문서를 나레이션 영상으로" - "얼굴 안 나오
media-higgsfield-identityHiggsfield MCP에서 재사용 가능한 인물·사물 일관성 참조를 만듭니다. Soul Character(학습형 identity 모델)와 Reference Element(즉시 생성형 참조) 중 어느 쪽을 써야 하는지 판정하고, 선택된 경로로 생성·조회합니다. 다음과 같은 요청 시 사용하세요: - "내 얼굴로 Soul 만
media-higgsfield-imageHiggsfield MCP 기반 AI 이미지를 자연어 요청 한 줄로 생성합니다. 모델·파라미터를 하드코딩하지 않고 라이브 카탈로그(models_explore)를 조회해 호출하므로, 카탈로그가 바뀌어도 드리프트 없이 동작합니다. 다음과 같은 요청 시 사용하세요: - "Higgsfield로 이미지 만들어 줘" - "Soul로
media-higgsfield-product브랜드·제품 비주얼 요청을 10개 촬영 모드 중 하나로 판정하고, 그 모드에 맞는 프롬프트 구조를 조립해 Higgsfield MCP로 이미지를 생성합니다. 스튜디오 컷·라이프스타일·핀터레스트 핀·히어로 배너·캐러셀· 광고 크리에이티브 팩·가상 피팅·컨셉추얼·리스타일이 범위입니다. 다음과 같은 요청 시 사용하세요: - "제
media-higgsfield-videoHiggsfield MCP 기반 AI 영상을 자연어 요청 한 줄로 생성합니다. 모델·파라미터를 하드코딩하지 않고 라이브 카탈로그(models_explore)를 조회해 호출하므로, 카탈로그가 바뀌어도 드리프트 없이 동작합니다. 다음과 같은 요청 시 사용하세요: - "Higgsfield 영상 만들어줘" - "Veo로 영상"
media-midjourney-v8-promptMidjourney v8.1 (2026.03 Alpha) 전용 이미지 프롬프트 빌더. 사용자 자연어 한 줄 + AskUserQuestion 프리셋·미세조정으로 컨텍스트를 수집해 Midjourney 공식 Parameter List 기반 키워드+`--파라미터` 형식으로 변환합니다. Discord `/imagine` 또는 al
media-notebooklm-slide-prompt강연·강의·세미나 본문 마크다운을 입력받아 (1) NotebookLM Studio에 그대로 붙여 넣을 슬라이드 데크 생성 프롬프트와 (2) 슬라이드별 나노바나나(Gemini 3 Pro Image, a.k.a. Nano Banana Pro) 5-Component 이미지 프롬프트를 동시 산출하는 prompt-builder 스

에이전트

media-producer(실행 직원)가 이미지·영상·오디오를 생성하고, media-brand-auditor(검수 직원)가 산출물이 브랜드 톤·일관성 기준에 맞는지 검수합니다.

에이전트역할유형
media-brand-auditormoai-media 플러그인의 읽기 전용 회의적 검수자. media-producer 또는 media-* 스킬이 생성한 이미지·영상·오디오 자산과 생성 프롬프트를 독립적으로 평가합니다. 브랜드/스타일 일치, 저작권·라이선스 위험, 프롬프트 인젝션/안전하지 않은 콘텐츠 위험, 프롬프트 엔지니어링 품질을 점검합니다. 증거 기반 PASS/FAIL 판정을 반환하며,검수 (읽기 전용)
media-producermoai-media 플러그인의 멀티모달 미디어 생성 프로듀서. 이미지·영상·오디오 생성 — Higgsfield 이미지/영상, ElevenLabs TTS/보이스클로닝/더빙, GPT-image-2/Gemini 3/Midjourney v8/codex/NotebookLM 슬라이드용 빌드 프롬프트 — 을 요청할 때 사용합니다. 이 플러그인의 media-* 스킬 집합실행 (worker)

대표 시나리오 5선

1. Higgsfield 시네마틱 숏. “이 제품 15초 시네마틱 숏으로 만들어줘"라고 하면 media-higgsfield-video가 Higgsfield MCP로 영상을 생성합니다. 사전에 예상 크레딧을 고지합니다.

2. 이미지 프롬프트 빌드. “이 캠페인 키비주얼을 GPT-image와 Midjourney용 프롬프트로 뽑아줘"라고 하면 media-gpt-image-2-prompt·media-midjourney-v8-prompt가 각 모델에 맞춘 완성 프롬프트를 제공합니다.

3. 음성 광고 제작. “20초 음성 광고 스크립트 음성으로 만들어줘"라고 하면 media-audio-gen이 ElevenLabs로 음성을 생성합니다.

4. 캐릭터 일관성 확보. “이 캐릭터가 모든 컷에 똑같이 나오게 해줘"라고 하면 media-higgsfield-identity가 먼저 경로를 가릅니다. 한 사람을 단독으로 쓰면 Soul 학습(사진 5~20장, 약 10분), 두 명 이상이 한 컷에 나오거나 제품·배경이면 Element입니다. 한 생성에 Soul은 하나만 들어가므로, 2인 컷은 Soul로 만들 수 없습니다. 판정이 애매하면 학습을 시작하지 않고 되묻습니다.

5. 설명 영상 제작. “이 주제로 3분짜리 내레이션 영상 만들어줘"라고 하면 media-higgsfield-explainer가 10초 블록 18개로 나눠 내레이션과 화면을 1:1로 짝지어 만든 뒤 서버에서 조립합니다. 스타일을 먼저 고르고 나머지 설정을 정하는 2단계 질문 순서를 지킵니다.

잘 안 될 때 — Higgsfield 생성 실패 시 프롬프트 온리 폴백으로 전환합니다. OAuth 인증은 Higgsfield MCP 설정을 참고하세요.

MCP 연동

  • higgsfield — 이미지·영상 생성. Higgsfield OAuth 인증이 필요합니다 (설정 가이드).
  • ElevenLabs — 텍스트 음성 변환·보이스 클로닝. ElevenLabs API 키가 필요합니다.