응답 생성 중에도 멈추지 않는 스트리밍 시계열 상호작용 모델 TimeInteract

TimeInteract: Towards Real-Time Interactive Intelligence for Streaming Time Series

arXiv2609.26389v1

Sheng Pan2026-09-22조회 5

무엇인가

이 논문이 다루는 문제는 시계열이 한 번에 주어지는 정적인 입력이 아니라 계속 도착하는 스트림이라는 점이다. 의료 모니터링, 산업 시스템, 금융 시장, 에너지 분야에서는 관측이 점진적으로 들어오고 사용자는 스트림 도중에 새 질의를 하거나 모니터링 목표를 바꿀 수 있다. 기존 시계열 언어 모델(TSLM)은 완전한 시퀀스를 받아 오프라인으로 처리하거나, 스트리밍 입력과 응답 생성을 번갈아 수행하는 데 그쳐 응답 생성 중에는 새 관측을 처리하지 못한다. 논문은 Time-Series Interaction이라는 새 체계를 제안한다. 모델은 C≤t로 표시되는 계속 진화하는 시계열 스트림과 선택적 사용자 질의·지시 E≤t를 받고, 이전 결정 d<t와 응답 r<t를 조건으로 매 단계 d_t ∈ {silent, respond}를 결정하며, respond일 때 r_t를 생성한다. silent는 텍스트 출력 없이 스트림 처리를 계속하고, respond는 새 관측이 도착하는 동안에도 응답 생성을 시작한다.

어떻게 동작하나

TimeInteract의 첫 번째 구성 요소는 이중 뷰 스트리밍 시계열 인코더다. 오프라인 모델은 전체 입력의 통계로 정규화하지만, 스트리밍에서는 현재 청크 C_t가 국소 변동과 누적 역사 대비 변화를 동시에 담는다. 그래서 논문은 두 뷰를 만든다. Fast View는 현재 청크의 평균과 표준편차로 정규화해 국소 변동을 강조하고, Historical View는 t 이전까지 누적된 역사 통계로 정규화해 관측이 역사 스트림과 얼마나 다른지 포착한다. 역사 통계는 C_t를 처리한 뒤에만 갱신되어 현재 청크가 자기 자신의 역사 뷰에 영향을 주지 않는다. 정규화된 두 뷰는 패치 단위 표현으로 바뀌고, 독립적인 Fast Mamba와 Slow Mamba 인코더에 들어간다. 두 인코더는 청크를 넘어 유지되는 SSM 상태를 가지며, 갱신률은 α_F > α_S로 설정되어 Slow Stream이 역사를 더 오래 보존하고 Fast Stream이 최근 변화에 더 빠르게 반응한다. 출력은 RMSNorm과 학습된 투영을 거쳐 LLM 은닉 공간의 Fast·Slow 소프트 토큰으로 삽입되고, LLM의 self-attention이 변수 간 의존성을 모델링한다.

무엇과 다른가

두 번째는 응답 제어와 잠재 계획이다. 각 스트리밍 단계에서 TimeInteract는 Fast·Slow 토큰, 사용자 질의·지시, 이전 결정, 이전 응답을 나타내는 Plan 토큰 P_<t로 인과적 문맥 H^P_t를 만든다. 제어 헤드 G_ctrl은 H^P_t의 은닉 상태로 silent 또는 respond를 예측하고, respond일 때만 Plan 헤드 G_plan이 K개의 연속 Plan 토큰 P_t ∈ R^{K×D}를 생성한 뒤 응답 r_t를 디코딩한다. 응답 이벤트가 드물기 때문에 제어 결정은 가중 교차 엔트로피 L_control로 감독한다. Plan 토큰은 제어 이력에 남아 이후 결정에 영향을 주므로, 전체 응답이 끝날 때까지 기다리지 않고도 스트림 처리를 계속할 수 있다. 추론 시 응답 이력을 압축적으로 유지하기 위해 Full-to-Plan 증류를 쓴다. Full View는 이전 정답 응답 r*_<t를 문맥에 추가하고, Plan View는 이전 응답 텍스트를 제외한 H^P_t만 유지한다. 두 뷰 모두 현재 Plan 토큰과 같은 대상 응답 접두사를 조건으로 하며, Full View의 토큰 분포를 Plan View로 증류하는 L_distill과 Full View 생성을 감독하는 L_full을 함께 최적화한다. 학습은 세 단계다. Stage I은 단일 턴의 단순 상호작용으로 형식을 익히며 LLM을 고정하고 증류를 끈다. Stage II는 단일 턴의 모든 상호작용 과제에서 LLM을 풀고 세 손실을 함께 최적화해 응답 타이밍과 Plan 토큰 활용을 배운다. Stage III는 다중 턴과 복합 시나리오를 포함한 전체 데이터로 확장한다.

어떻게 쓰나

세 번째는 KV forking을 통한 분리형 스트리밍 추론이다. 자가회귀 응답 생성은 여러 시계열 청크에 걸칠 수 있는데, 기존 인터리브 방식은 현재 응답을 끝내야 다음 입력을 처리하므로 응답 생성이 입력 스트림을 막는다. TimeInteract는 추론을 지속적인 Control Stream과 일시적인 Response Stream으로 나누고, 같은 언어 모델을 서로 다른 KV 캐시로 운용한다. Control 캐시 KV^ctrl은 Plan View를 따라 시간 토큰, 사용자 지시, 결정, Plan 토큰을 누적하고, TS 인코더는 청크 간 상태를 유지한다. 스트리밍 단계 t에서 Encode가 청크 C_t를 시간 블록 B_t로 인코딩하고 Control이 d_t를 예측해 커밋한다. silent면 응답 요청 없이 제어 단계가 닫힌다. respond면 Plan이 P_t를 추가하고 첫 응답 토큰 예측에 쓰이는 캐시 KV*_t와 은닉 상태 h^r_t를 반환한다. 이 캐시는 계속되는 제어 분기 KV^ctrl과 응답 분기 KV^resp_t로 포크된다. FinishStep은 응답 분기를 건드리지 않고 현재 제어 단계를 닫고, 이후 캐시 갱신은 분리된다. 새 관측은 제어 이력만 확장하고 생성된 텍스트는 응답 분기만 확장한다. 각 응답 스트림은 LaunchResponse로 비동기 실행되고 큐 Q에서 추적되며, 응답이 끝나면 캐시는 해제되지만 Plan 토큰은 제어 이력에 남는다.

전제와 한계

데이터셋은 StreamTSI-34K다. 34,588개의 상호작용 에피소드와 77,505개의 주석 응답(에피소드당 1~10개)을 포함하고, 합성 신호와 6개 도메인의 실제 시계열을 함께 사용한다. 상호작용 과제는 Instant Query Answering(IQA), Persistent Instruction Following(PIF), Proactive Temporal Warning(PTW), User-Guided Adaptation(UGA) 네 가지다. 단일 턴 에피소드가 56.9%, 여러 과제를 조합한 다중 턴 상호작용이 43.1%다. 합성 데이터는 구성 가능한 추세, 계절 패턴, 국소 이벤트, 잡음으로 만들고 이벤트 속성·시간 위치·변수 간 관계를 메타데이터로 보존한다. 실제 데이터는 에너지, 금융, 헬스케어, 인간 활동, 환경, 제조의 12개 데이터셋에서 수집한다. 상호작용에 관련된 시간 구성 요소로 국소 이벤트, 구간 수준 패턴, 변수 간 관계, 데이터 품질 문제를 식별한다. 합성 데이터는 생성 메타데이터로 알려진 시간 위치를 쓰고, 실제 데이터는 LLM 보조 주석으로 그럴듯한 상호작용 시나리오와 시간 근거를 찾는다. 상호작용 생성은 과제별 템플릿·규칙과 LLM 생성을 결합하며, 각 상호작용은 선택적 사용자 질의·지시, 응답 위치, 응답 텍스트를 지정하고 응답은 주석된 위치까지 사용 가능한 관측에만 근거한다. 품질 관리는 LLM 검증으로 과제 일관성, 응답 타이밍, 관측 근거를 확인하고 실패한 데이터는 검증 피드백으로 재생성한다. 이후 규칙 기반 필터링을 거치고, 고신뢰 샘플은 바로 채택하며 저신뢰 사례는 수동 검토한다.

실험은 일반 LLM(Qwen2.5-7B-Instruct, Mistral-7B-Instruct-v0.3, Qwen3-14B), 비전-언어 모델(Qwen2.5-VL-7B, InternVL3.5-8B), 시계열 언어 모델(ChatTS, TimeOmni-1)과 비교한다. 평가는 네 상호작용 수준 전체를 대상으로 하며 Understanding에는 Semantic Correctness(SC), Persistence에는 Instruction Fulfillment Rate(IFR)를 포함한 과제별 지표를 쓰고, Initiative와 Adaptivity 지표도 사용한다. 단일 턴과 다중 턴 설정 모두 보고한다. 주요 결과로 TimeInteract는 두 설정의 네 수준 모두에서 1위이고, 가장 큰 향상은 UGA에서 단일 턴 +22.22점, 다중 턴 +23.92점이다. 다중 턴에서 턴 수가 늘어도 성능이 안정적이며(예: IQA 67.34 → 64.56, PTW 45.95 → 38.03) 모든 베이스라인을 앞선다. 응답 트리거링에서는 두 설정 모두 F1과 NQ-F1이 가장 높다. 다중 턴에서 InternVL3.5-8B는 재현율 98.24지만 정밀도 23.66으로 과다 트리거하고, TimeOmni-1은 지나치게 보수적이어서 필요한 응답을 억제하는 경향이 있다. 실시간 효율은 인터리브 추론과 비슷한 TTFT를 보이며 Plan·제어 헤드 오버헤드가 거의 없다. 응답이 길어질수록 이득이 커져 오프라인 대비 1.80배에서 2.15배, 인터리브 대비 1.26배에서 1.59배 속도 향상을 얻는다. 스트림 정지 시간은 거의 0이고 모든 그룹에서 단계당 시간이 가장 낮다. 추가 분석에서 세 단계 학습은 F1을 55 → 65 → 86으로, No-Query F1을 0 → 59로 올린다. Plan 토큰은 이전 상호작용 정보를 보존한다. 3406.9 ppm 피크를 식별한 뒤 이전 응답 텍스트가 없어도 Plan 토큰으로 후속 질문에 3506.9 ppm이라고 정답을 내며, Plan 토큰을 무작위 임베딩으로 바꾸면 1100 ppm으로 바뀌고 정답 연속에 대한 확률도 낮아진다. 절제 실험에서 Slow TS 토큰, Fast TS 토큰, Plan 토큰 임베딩을 교란하면 모두 F1과 NQ-F1이 떨어지고, Slow TS 임베딩 교란이 가장 큰 하락을 일으켜 응답 트리거링에 가장 큰 영향을 준다. Plan 임베딩 교란도 이후 응답 결정에 중요한 상호작용 정보 보존의 필요성을 보여준다. 상호작용 깊이와 스트림 길이가 늘어도 성능 저하는 완만하고 F1은 모든 설정에서 75 이상을 유지한다.

개발자에게 이 논문은 실시간 모니터링, 이상 징후 경보, 스트리밍 데이터에 대한 다중 턴 질의응답을 만드는 경우에 직접적인 설계 참고가 된다. 핵심은 입력 수신과 응답 생성을 분리해 응답이 다음 관측 처리를 막지 않게 만드는 KV forking 구조, 응답 여부를 스스로 결정하는 제어 헤드, 그리고 이전 응답을 압축해 다음 결정에 전달하는 Plan 토큰이다. 실무에서는 침묵과 응답의 균형을 나타내는 F1·NQ-F1, TTFT와 완료 지연, 스트림 정지 시간, 긴 응답에서의 속도 향상을 확인해야 한다. 또한 IQA·PIF·PTW·UGA처럼 과제별로 요구되는 상호작용 수준이 다르므로, 배포하려는 도메인에서 단일 턴뿐 아니라 다중 턴 의존성과 사용자 피드백 반영이 안정적인지 검증해야 한다.

원문에는 별도의 한계 절이 없고 결론에서도 명시적 한계를 나열하지 않는다. 다만 방법과 데이터 구성에서 확인되는 전제가 있다. 실제 시계열의 상호작용 시나리오와 시간 근거는 LLM 보조 주석으로 식별되며, 응답은 주석된 위치까지 사용 가능한 관측에만 근거하도록 생성된다. 저신뢰 샘플은 수동 검토를 거치지만, 합성 데이터와 실제 데이터의 분포 차이, LLM 주석 오류, 장기 배포에서의 분포 이동, 계산 비용, 개인정보·보안 제약은 원문에서 별도로 논의되지 않는다. 따라서 실제 시스템에 적용할 때는 도메인별 데이터로 응답 트리거 정밀도와 지연 시간을 재검증하고, Plan 토큰이 장기 이력에서 어떤 정보를 잃는지 확인하는 것이 필요하다.